AI BENCHY ناکامیاں
غلط جواب ناکامیاں
دیکھیں کہ کن AI ماڈلز میں غلط جواب سب سے زیادہ ہوتا ہے، تاکہ آپ انتخاب سے پہلے قابلِ اعتماد ہونے کے خطرات سمجھ سکیں۔ ترتیب دیں حسب: ردِعمل کا وقت (اوسط) ↓.
| درجہ | ماڈل | کمپنی | غلط جواب کی تعداد | اسکور | درست ٹیسٹس | ردِعمل کا وقت (اوسط) |
|---|---|---|---|---|---|---|
| #50 | Hunter Alpha medium | OpenRouter | 4 | 6.7 | 8/18 | 10.3s |
| #47 | Grok 4.20 medium | X AI | 3 | 7.0 | 9/18 | 10.3s |
| #87 | Qwen3 Coder Next none | Qwen | 12 | 5.1 | 4/18 | 10.2s |
| #25 | Grok 4.20 Beta medium | X AI | 3 | 8.0 | 12/18 | 9.81s |
| #56 | Grok 4.20 Multi Agent Beta medium | X AI | 3 | 6.4 | 7/18 | 9.80s |
| #12 | Gemini 3 PRO Preview medium | 3 | 8.4 | 14/18 | 9.06s | |
| #88 | Nemotron 3 Super none | NVIDIA | 10 | 5.1 | 4/18 | 8.54s |
| #28 | GPT-5.2 Chat none | OpenAI | 5 | 7.9 | 12/18 | 6.84s |
| #60 | Gemma 4 26B A4B none | 7 | 6.2 | 7/18 | 6.59s | |
| #5 | Gemini 3 Flash Preview low | 3 | 8.8 | 15/18 | 6.01s | |
| #36 | GPT-5.3 Chat none | OpenAI | 5 | 7.7 | 11/18 | 5.88s |
| #73 | Mistral Small 4 medium | Mistral | 8 | 5.7 | 5/18 | 5.64s |
| #78 | Trinity Large Preview none | Arcee AI | 11 | 5.3 | 5/18 | 5.07s |
| #42 | Claude Sonnet 4.6 none | Anthropic | 3 | 7.4 | 11/18 | 4.98s |
| #72 | Hunter Alpha none | OpenRouter | 9 | 5.7 | 6/18 | 4.58s |