غلط جواب ناکامیاں
دیکھیں کہ کن AI ماڈلز میں غلط جواب سب سے زیادہ ہوتا ہے، تاکہ آپ انتخاب سے پہلے قابلِ اعتماد ہونے کے خطرات سمجھ سکیں۔ ترتیب دیں حسب: ناکامیوں کی تعداد ↑.
209/209
ماڈلز فلٹر کریں
موجودہ تلاش اور فلٹرز سے کوئی ماڈل مطابقت نہیں رکھتا۔
| درجہ | ماڈل | کمپنی | غلط جواب کی تعداد | اسکور | کل لاگت | درست ٹیسٹس | ردِعمل کا وقت (اوسط) |
|---|---|---|---|---|---|---|---|
| #171 | North Mini Code none | Cohere | 12 | 5.1 | $0.000 | 4/22 | 29.9s |
| #183 | Trinity Large Preview none | Arcee AI | 12 | 4.8 | $0.008 | 4/21 | 2.98s |
| #116 | Seed-2.0-Lite none | Bytedance Seed | 13 | 6.2 | $0.066 | 8/22 | 4.40s |
| #125 | Qwen3.5-Flash none | Qwen | 13 | 6.1 | $0.073 | 8/22 | 25.3s |
| #136 | GPT-5.4 Mini none | OpenAI | 13 | 5.9 | $0.095 | 6/22 | 1.53s |
| #142 | Qwen3.5-122B-A10B none | Qwen | 13 | 5.7 | $0.247 | 6/22 | 12.9s |
| #151 | GLM 5.1 none | Z.ai | 13 | 5.5 | $0.164 | 7/22 | 6.70s |
| #161 | Qwen3.6 35B A3B none | Qwen | 13 | 5.3 | $0.061 | 4/22 | 5.52s |
| #164 | Inkling none | Thinkingmachines | 13 | 5.2 | $0.147 | 6/22 | 3.50s |
| #170 | GLM 5 Turbo none | Z.ai | 13 | 5.1 | $0.047 | 6/21 | 2.82s |
| #176 | GLM 4.7 Flash none | Z.ai | 13 | 4.9 | $0.016 | 6/22 | 9.15s |
| #182 | KAT-Coder-Air V2.5 none | Kwaipilot | 13 | 4.8 | $0.067 | 5/22 | 12.2s |
| #187 | Qwen3 Coder Next medium | Qwen | 13 | 4.7 | $0.032 | 4/22 | 9.61s |
| #200 | MiMo-V2-Flash none | Xiaomi | 13 | 4.0 | $0.025 | 4/21 | 2.76s |
| #201 | Granite 4.1 8B none | IBM Granite | 13 | 4.0 | $0.007 | 2/22 | 1.45s |