غلط جواب ناکامیاں
دیکھیں کہ کن AI ماڈلز میں غلط جواب سب سے زیادہ ہوتا ہے، تاکہ آپ انتخاب سے پہلے قابلِ اعتماد ہونے کے خطرات سمجھ سکیں۔ ترتیب دیں حسب: ردِعمل کا وقت (اوسط) ↑.
دکھائے گئے ماڈلز
15
کل ناکامیاں
2265
سب سے زیادہ متاثر ماڈل
Nemotron 3 Nano Omni 30b A3b Reasoning 9
313/313
ماڈلز فلٹر کریں
موجودہ تلاش اور فلٹرز سے کوئی ماڈل مطابقت نہیں رکھتا۔
| درجہ | ماڈل | کمپنی | غلط جواب کی تعداد | اسکور | کل لاگت | درست ٹیسٹس | ردِعمل کا وقت (اوسط) |
|---|---|---|---|---|---|---|---|
| #59 | Muse Spark 1.3 low | Meta | 4 | 8.2 | $0.689 | 15/22 | 16.0s |
| #51 | Grok 4.5 low | X AI | 6 | 8.4 | $0.945 | 16/22 | 16.2s |
| #166 | Gemini 3.1 Flash Lite low | 8 | 6.6 | $0.621 | 13/22 | 16.2s | |
| #172 | Hy3 preview medium | Tencent | 3 | 6.5 | $0.049 | 14/21 | 16.3s |
| #91 | GPT-5.6 Luna high | OpenAI | 8 | 7.6 | $0.179 | 14/22 | 16.5s |
| #164 | Gemini 3.1 Flash Lite Preview low | 6 | 6.6 | $0.646 | 14/22 | 16.7s | |
| #1 | Gemini 3.6 Flash high | 1 | 9.9 | $0.699 | 21/22 | 16.8s | |
| #30 | GPT-5.3-Codex medium | OpenAI | 4 | 8.9 | $0.988 | 16/22 | 16.9s |
| #313 | Nemotron 3 Nano Omni 30b A3b Reasoning medium | NVIDIA | 7 | 3.4 | $0.000 | 4/19 | 17.1s |
| #129 | Step 3.7 Flash low | Stepfun | 9 | 7.1 | $0.390 | 11/22 | 17.9s |
| #267 | DeepSeek V3.2 none | DeepSeek | 8 | 5.0 | $0.054 | 6/22 | 17.9s |
| #243 | Kimi K2.5 none | Moonshot AI | 16 | 5.4 | $0.101 | 5/22 | 18.0s |
| #128 | Muse Glimmer 30B low | Meta | 6 | 7.1 | $0.143 | 11/22 | 18.6s |
| #4 | GPT-6 Astra high | OpenAI | 1 | 9.9 | $3.474 | 21/22 | 18.6s |
| #261 | Qwen3.5-9B none | Qwen | 14 | 5.1 | $0.021 | 4/22 | 19.2s |