AI BENCHY
Advertise here

AI BENCHY विफलताएँ

गलत उत्तर विफलताएँ

देखें कि किन AI मॉडलों में गलत उत्तर सबसे अधिक होता है, ताकि आप चुनने से पहले भरोसेमंदी के जोखिम समझ सकें। क्रमबद्ध करें: सही परीक्षण ↑.

दिखाए गए मॉडल

15

कुल विफलताएँ

1204

सबसे अधिक प्रभावित मॉडल

Granite 4.1 8B 13
रैंक मॉडल कंपनी गलत उत्तर संख्या स्कोर सही परीक्षण प्रतिक्रिया समय (औसत)
#108 Qwen3.5-Flash none Qwen 13 5.8 8/21 3.58s
#109 GLM 5V Turbo none Z.ai 11 5.8 8/21 2.99s
#110 Seed-2.0-Lite none Bytedance Seed 13 5.8 8/21 2.49s
#111 Owl Alpha medium Openrouter 10 5.7 8/21 11.9s
#90 Gemini 3.1 Flash Lite none Google 11 6.4 9/21 1.06s
#94 GPT-5 Nano medium OpenAI 9 6.3 9/21 42.5s
#95 Qwen3.5 Plus 2026-02-15 none Qwen 12 6.3 9/21 2.31s
#96 Ring-2.6-1T none Inclusionai 5 6.2 9/21 55.1s
#97 Gemini 2.5 Flash none Google 12 6.2 9/21 875ms
#98 GLM 5 none Z.ai 12 6.1 9/21 4.03s
#99 gpt-oss-120b medium OpenAI 9 6.1 9/21 22.3s
#79 Hunter Alpha medium OpenRouter 4 6.7 8/18 10.3s
#84 Grok 4.20 Multi Agent Beta medium X AI 4 6.6 8/18 9.69s
#86 Grok 4.1 Fast medium X AI 4 6.5 9/19 23.8s
#92 Laguna M.1 medium Poolside 4 6.4 9/19 14.7s

गलत उत्तर संख्या के अनुसार शीर्ष मॉडल

गलत उत्तर संख्या बनाम स्कोर

प्रतिक्रिया समय (औसत) के अनुसार शीर्ष मॉडल