AI BENCHY زمرہ ناکامیاں
پہیلی حل کرنا: غلط جواب
پہیلی حل کرنا
غلط جواب
دیکھیں کہ پہیلی حل کرنا میں کن AI ماڈلز کو غلط جواب پیش آنے کا سب سے زیادہ امکان ہے، تاکہ آپ کمزوریاں جلدی پہچان سکیں۔
ناکامی کی وجوہات
| درجہ | ماڈل | کمپنی | غلط جواب کی تعداد | زمرہ اسکور | درست ٹیسٹس | ردِعمل کا وقت (اوسط) |
|---|---|---|---|---|---|---|
| #67 | Qwen3.5-27B none | Qwen | 1 | 6.7 | 1/3 | 1.37s |
| #68 | gpt-oss-120b medium | OpenAI | 1 | 3.2 | 0/3 | 11.8s |
| #69 | Kimi K2.6 none | Moonshot AI | 1 | 3.4 | 0/3 | 1.66s |
| #71 | MiniMax M2.5 medium | Minimax | 1 | 5.3 | 1/3 | 11.5s |
| #72 | Hunter Alpha none | OpenRouter | 1 | 5.8 | 1/3 | 3.06s |
| #73 | Mistral Small 4 medium | Mistral | 1 | 3.4 | 0/3 | 2.00s |
| #74 | GLM 4.7 Flash none | Z.ai | 1 | 4.4 | 0/3 | 1.00s |
| #75 | GLM 5.1 none | Z.ai | 1 | 5.7 | 1/3 | 1.48s |
| #77 | GLM 5 Turbo none | Z.ai | 1 | 5.5 | 1/3 | 2.43s |
| #79 | Grok 4.20 Beta none | X AI | 1 | 5.9 | 1/3 | 541ms |
| #80 | MiniMax M2.7 medium | Minimax | 1 | 3.8 | 0/3 | 25.6s |
| #81 | Elephant medium | Openrouter | 1 | 3.7 | 0/3 | 867ms |
| #82 | Grok 4.20 none | X AI | 1 | 5.3 | 1/3 | 487ms |
| #83 | Mistral Small 4 none | Mistral | 1 | 3.1 | 0/3 | 589ms |
| #84 | gpt-oss-120b none | OpenAI | 1 | 4.5 | 0/3 | 6.86s |