غلط جواب ناکامیاں
دیکھیں کہ کن AI ماڈلز میں غلط جواب سب سے زیادہ ہوتا ہے، تاکہ آپ انتخاب سے پہلے قابلِ اعتماد ہونے کے خطرات سمجھ سکیں۔ ترتیب دیں حسب: اسکور ↑.
313/313
ماڈلز فلٹر کریں
موجودہ تلاش اور فلٹرز سے کوئی ماڈل مطابقت نہیں رکھتا۔
| درجہ | ماڈل | کمپنی | غلط جواب کی تعداد | اسکور | کل لاگت | درست ٹیسٹس | ردِعمل کا وقت (اوسط) |
|---|---|---|---|---|---|---|---|
| #240 | KAT-Coder-Air V2.5 low | Kwaipilot | 7 | 5.4 | $0.046 | 7/22 | 10.6s |
| #241 | GPT-5.6 Luna none | OpenAI | 14 | 5.4 | $0.029 | 6/22 | 1.50s |
| #239 | Laguna S 2.1 medium | Poolside | 13 | 5.4 | $0.053 | 4/22 | 58.4s |
| #238 | DeepSeek V4 Flash 0423 none | DeepSeek | 13 | 5.4 | $0.039 | 4/22 | 36.2s |
| #237 | Mimo V2 Omni none | Xiaomi | 10 | 5.5 | $0.021 | 8/21 | 2.44s |
| #236 | Qwen3.8 27B none | Qwen | 11 | 5.5 | ~$0.006 | 9/22 | 3.12s |
| #235 | Hy3 preview low | Tencent | 4 | 5.5 | $0.042 | 10/21 | 24.6s |
| #234 | Qwen3.6 27B none | Qwen | 11 | 5.5 | $0.062 | 7/22 | 10.6s |
| #233 | Hy4 preview low | Tencent | 3 | 5.6 | $1.745 | 3/22 | 214.3s |
| #232 | Nemotron 3.5 Lightning high | NVIDIA | 11 | 5.6 | $0.134 | 5/22 | 58.3s |
| #231 | KAT-Coder-Air V2.5 medium | Kwaipilot | 10 | 5.6 | $0.048 | 8/22 | 8.65s |
| #230 | Owl Alpha none | Openrouter | 10 | 5.6 | $0.000 | 7/21 | 9.88s |
| #229 | Mimo V2 PRO none | Xiaomi | 11 | 5.6 | $0.045 | 7/21 | 2.27s |
| #228 | Gemma 4 26B A4B none | 9 | 5.6 | $0.015 | 9/22 | 7.58s | |
| #227 | Owl Alpha medium | Openrouter | 10 | 5.6 | $0.000 | 8/21 | 11.9s |