ہدایات کی پیروی درجہ بندی
دیکھیں کہ ہدایات کی پیروی میں کون سے AI ماڈلز بہترین کارکردگی دکھاتے ہیں، کون سے قابلِ اعتماد رہتے ہیں، اور سب سے بڑے فرق کہاں نظر آتے ہیں۔ ترتیب دیں حسب: کل لاگت ↑.
319/319
ماڈلز فلٹر کریں
موجودہ تلاش اور فلٹرز سے کوئی ماڈل مطابقت نہیں رکھتا۔
| درجہ | ماڈل | کمپنی | ہدایات کی پیروی اسکور | اسکور | کل لاگت | درست ٹیسٹس | ردِعمل کا وقت (اوسط) |
|---|---|---|---|---|---|---|---|
| #56 | Qwen3.8 27B high | Qwen | 9.8 | 8.4 | ~$0.287 | 2/2 | 8.24s |
| #161 | Gemini 3.5 Flash minimal | 6.4 | 6.7 | $0.300 | 1/2 | 893ms | |
| #100 | MiniMax M3 medium | Minimax | 9.8 | 7.5 | $0.300 | 2/2 | 6.14s |
| #12 | Gemini 3.7 Flash medium | 10.0 | 9.4 | $0.309 | 2/2 | 2.81s | |
| #127 | Qwen3.5 Plus 2026-04-20 medium | Qwen | 10.0 | 7.2 | $0.323 | 2/2 | 20.2s |
| #93 | GLM 5 Turbo medium | Z.ai | 10.0 | 7.6 | $0.323 | 2/2 | 5.38s |
| #292 | MiniMax M2.5 medium | Minimax | 7.5 | 4.6 | $0.327 | 1/2 | 621ms |
| #184 | Mimo V2 PRO medium | Xiaomi | 9.9 | 6.3 | $0.333 | 2/2 | 3.36s |
| #8 | GPT-5.6 Sol low | OpenAI | 10.0 | 9.5 | $0.357 | 2/2 | 2.27s |
| #72 | Inkling medium | Thinkingmachines | 9.8 | 8.0 | $0.383 | 2/2 | 6.17s |
| #206 | Gemini 3 PRO Preview medium | 9.8 | 6.0 | $0.385 | 2/2 | 3.26s | |
| #132 | Step 3.7 Flash low | Stepfun | 9.8 | 7.1 | $0.390 | 2/2 | 1.58s |
| #217 | GPT-5.4 none | OpenAI | 6.5 | 5.8 | $0.397 | 1/2 | 1.07s |
| #126 | Muse Glimmer 30B high | Meta | 8.4 | 7.2 | $0.397 | 1/2 | 8.62s |
| #58 | Inkling Small high | Thinkingmachines | 9.8 | 8.4 | $0.398 | 2/2 | 3.94s |