غلط جواب ناکامیاں
دیکھیں کہ کن AI ماڈلز میں غلط جواب سب سے زیادہ ہوتا ہے، تاکہ آپ انتخاب سے پہلے قابلِ اعتماد ہونے کے خطرات سمجھ سکیں۔ ترتیب دیں حسب: اسکور ↑.
313/313
ماڈلز فلٹر کریں
موجودہ تلاش اور فلٹرز سے کوئی ماڈل مطابقت نہیں رکھتا۔
| درجہ | ماڈل | کمپنی | غلط جواب کی تعداد | اسکور | کل لاگت | درست ٹیسٹس | ردِعمل کا وقت (اوسط) |
|---|---|---|---|---|---|---|---|
| #181 | Mimo V2 PRO medium | Xiaomi | 5 | 6.3 | $0.333 | 12/21 | 22.2s |
| #180 | Ring-2.6-1T medium | Inclusionai | 6 | 6.4 | $0.102 | 11/22 | 68.8s |
| #179 | Ling-3.0-flash high | Inclusionai | 7 | 6.4 | $0.021 | 12/22 | 13.7s |
| #178 | MiMo-V2.5 medium | Xiaomi | 5 | 6.4 | $0.104 | 11/22 | 46.3s |
| #177 | LongCat 2.0 none | Meituan | 13 | 6.4 | $0.044 | 8/22 | 5.17s |
| #176 | Dots 3 Note Preview high | Dots Studio | 8 | 6.4 | $0.000 | 10/22 | 67.8s |
| #175 | Dots 3 Note Preview low | Dots Studio | 7 | 6.4 | $0.000 | 10/22 | 61.8s |
| #174 | Qwen3.6 Max Preview none | Qwen | 11 | 6.4 | $0.228 | 11/22 | 7.82s |
| #173 | Gemini 3.1 Flash Lite Preview none | 7 | 6.4 | $0.052 | 12/22 | 1.56s | |
| #172 | Hy3 preview medium | Tencent | 3 | 6.5 | $0.049 | 14/21 | 16.3s |
| #171 | Laguna XS 2.1 medium | Poolside | 10 | 6.5 | $0.068 | 9/22 | 48.2s |
| #170 | Qwen3.6 27B medium | Qwen | 5 | 6.5 | $0.577 | 10/22 | 106.1s |
| #169 | Qwen3.5 Plus 2026-02-15 none | Qwen | 11 | 6.6 | $0.073 | 11/22 | 9.86s |
| #168 | Mercury 2.5 Preview high | Inception | 6 | 6.6 | $0.030 | 12/22 | 4.01s |
| #167 | Qwen3.6 35B A3B medium | Qwen | 5 | 6.6 | $0.672 | 12/22 | 58.5s |