ہدایات کی پیروی درجہ بندی
دیکھیں کہ ہدایات کی پیروی میں کون سے AI ماڈلز بہترین کارکردگی دکھاتے ہیں، کون سے قابلِ اعتماد رہتے ہیں، اور سب سے بڑے فرق کہاں نظر آتے ہیں۔ ترتیب دیں حسب: ردِعمل کا وقت (اوسط) ↓.
319/319
ماڈلز فلٹر کریں
موجودہ تلاش اور فلٹرز سے کوئی ماڈل مطابقت نہیں رکھتا۔
| درجہ | ماڈل | کمپنی | ہدایات کی پیروی اسکور | اسکور | کل لاگت | درست ٹیسٹس | ردِعمل کا وقت (اوسط) |
|---|---|---|---|---|---|---|---|
| #182 | Ling-3.0-flash high | Inclusionai | 10.0 | 6.4 | $0.021 | 2/2 | 1.85s |
| #76 | Step 3.7 Flash medium | Stepfun | 9.8 | 7.9 | $0.495 | 2/2 | 1.83s |
| #216 | Seed 2.1 Turbo none | Bytedance Seed | 9.8 | 5.9 | $0.092 | 2/2 | 1.82s |
| #196 | Inkling low | Thinkingmachines | 9.8 | 6.1 | $0.187 | 2/2 | 1.81s |
| #251 | Seed-2.0-Code none | Bytedance Seed | 6.2 | 5.3 | $0.151 | 1/2 | 1.80s |
| #181 | MiMo-V2.5 medium | Xiaomi | 9.9 | 6.4 | $0.104 | 2/2 | 1.80s |
| #94 | GPT-5.6 Luna high | OpenAI | 9.9 | 7.6 | $0.179 | 2/2 | 1.79s |
| #282 | KAT-Coder-Air V2.5 none | Kwaipilot | 9.9 | 4.8 | $0.070 | 2/2 | 1.75s |
| #165 | Gemini 3.5 Flash Lite low | 9.8 | 6.6 | $0.138 | 2/2 | 1.75s | |
| #80 | Gemini 3.5 Flash Lite medium | 9.8 | 7.8 | $0.272 | 2/2 | 1.72s | |
| #256 | Inkling none | Thinkingmachines | 6.3 | 5.2 | $0.147 | 1/2 | 1.72s |
| #302 | Laguna Xs.2 medium | Poolside | 10.0 | 4.1 | $0.015 | 2/2 | 1.68s |
| #218 | Solar Pro 4 none | Upstage | 6.4 | 5.8 | $0.006 | 1/2 | 1.67s |
| #172 | Qwen3.5 Plus 2026-02-15 none | Qwen | 10.0 | 6.6 | $0.073 | 2/2 | 1.67s |
| #214 | GLM 5.3 Flash low | Z.ai | 10.0 | 5.9 | $0.015 | 2/2 | 1.65s |