AI BENCHY विफलताएँ
गलत उत्तर विफलताएँ
देखें कि किन AI मॉडलों में गलत उत्तर सबसे अधिक होता है, ताकि आप चुनने से पहले भरोसेमंदी के जोखिम समझ सकें। क्रमबद्ध करें: विफलता संख्या ↑.
| रैंक | मॉडल | कंपनी | गलत उत्तर संख्या | स्कोर | सही परीक्षण | प्रतिक्रिया समय (औसत) |
|---|---|---|---|---|---|---|
| #119 | Cobuddy medium | Baidu | 9 | 5.6 | 7/21 | 39.9s |
| #136 | Elephant Alpha medium | Openrouter | 9 | 5.1 | 6/21 | 1.27s |
| #137 | Elephant Alpha none | Openrouter | 9 | 5.1 | 5/21 | 1.22s |
| #138 | Ling-2.6-flash none | Inclusionai | 9 | 5.0 | 6/21 | 9.34s |
| #158 | GLM 4.7 Flash medium | Z.ai | 9 | 4.4 | 4/21 | 35.1s |
| #160 | LFM2-24B-A2B none | Liquid | 9 | 4.2 | 2/16 | 782ms |
| #162 | Nemotron 3 Nano Omni 30b A3b Reasoning none | NVIDIA | 9 | 4.1 | 2/19 | 728ms |
| #74 | Qwen3.6 Max Preview none | Qwen | 10 | 6.9 | 11/21 | 3.30s |
| #88 | Qwen3.7 Plus none | Qwen | 10 | 6.4 | 10/21 | 2.85s |
| #101 | Mimo V2 Omni none | Xiaomi | 10 | 6.0 | 8/21 | 2.44s |
| #102 | Gemma 4 26B A4B none | 10 | 6.0 | 8/21 | 5.91s | |
| #106 | Grok 4.20 Beta none | X AI | 10 | 5.8 | 6/18 | 1.19s |
| #111 | Owl Alpha medium | Openrouter | 10 | 5.7 | 8/21 | 11.9s |
| #113 | DeepSeek V4 Pro none | DeepSeek | 10 | 5.7 | 7/21 | 12.4s |
| #121 | Owl Alpha none | Openrouter | 10 | 5.5 | 7/21 | 9.88s |