غلط جواب ناکامیاں
دیکھیں کہ کن AI ماڈلز میں غلط جواب سب سے زیادہ ہوتا ہے، تاکہ آپ انتخاب سے پہلے قابلِ اعتماد ہونے کے خطرات سمجھ سکیں۔ ترتیب دیں حسب: کل لاگت ↑.
215/215
ماڈلز فلٹر کریں
موجودہ تلاش اور فلٹرز سے کوئی ماڈل مطابقت نہیں رکھتا۔
| درجہ | ماڈل | کمپنی | غلط جواب کی تعداد | اسکور | کل لاگت | درست ٹیسٹس | ردِعمل کا وقت (اوسط) |
|---|---|---|---|---|---|---|---|
| #49 | DeepSeek V4 Flash high | DeepSeek | 6 | 7.7 | $0.041 | 13/22 | 49.7s |
| #147 | GLM 5 none | Z.ai | 12 | 5.7 | $0.041 | 9/21 | 4.03s |
| #186 | GPT-5.4 Nano none | OpenAI | 15 | 4.8 | $0.041 | 4/22 | 2.57s |
| #164 | KAT-Coder-Air V2.5 low | Kwaipilot | 7 | 5.4 | $0.041 | 7/22 | 10.1s |
| #156 | DeepSeek V4 Flash none | DeepSeek | 12 | 5.6 | $0.042 | 5/22 | 36.8s |
| #119 | MiMo-V2-Flash medium | Xiaomi | 5 | 6.3 | $0.043 | 12/21 | 20.1s |
| #117 | LongCat 2.0 none | Meituan | 14 | 6.3 | $0.044 | 7/22 | 5.18s |
| #153 | Mimo V2 PRO none | Xiaomi | 11 | 5.6 | $0.045 | 7/21 | 2.27s |
| #128 | Gemini 3.1 Flash Lite none | 11 | 6.1 | $0.046 | 9/22 | 1.75s | |
| #176 | GLM 5 Turbo none | Z.ai | 13 | 5.1 | $0.047 | 6/21 | 2.82s |
| #126 | Gemini 3.1 Flash Lite minimal | 8 | 6.1 | $0.047 | 10/22 | 1.86s | |
| #141 | Hy3 preview high | Tencent | 3 | 5.9 | $0.048 | 11/21 | 56.6s |
| #155 | KAT-Coder-Air V2.5 medium | Kwaipilot | 11 | 5.6 | $0.048 | 8/22 | 8.42s |
| #151 | GLM 5V Turbo none | Z.ai | 11 | 5.6 | $0.052 | 8/21 | 2.99s |
| #112 | Gemini 3.1 Flash Lite Preview none | 7 | 6.4 | $0.052 | 12/22 | 1.58s |