AI BENCHY
Your ad here

AI BENCHY विफलताएँ

गलत उत्तर विफलताएँ

देखें कि किन AI मॉडलों में गलत उत्तर सबसे अधिक होता है, ताकि आप चुनने से पहले भरोसेमंदी के जोखिम समझ सकें। क्रमबद्ध करें: प्रतिक्रिया समय (औसत) ↓.

दिखाए गए मॉडल

7

कुल विफलताएँ

572

सबसे अधिक प्रभावित मॉडल

Qwen3.5-9B 1
रैंक मॉडल कंपनी गलत उत्तर संख्या स्कोर सही परीक्षण प्रतिक्रिया समय (औसत)
#79 Grok 4.20 Beta none X AI 10 5.3 4/18 1.19s
#86 GPT-5.4 Mini none OpenAI 10 5.1 5/18 1.17s
#82 Grok 4.20 none X AI 9 5.2 5/18 1.11s
#62 Gemini 2.5 Flash none Google 10 6.2 7/18 903ms
#98 LFM2-24B-A2B none Liquid 9 4.1 1/16 811ms
#83 Mistral Small 4 none Mistral 11 5.2 5/18 665ms
#91 Mercury 2 none Inception 13 4.8 4/18 613ms

गलत उत्तर संख्या के अनुसार शीर्ष मॉडल

गलत उत्तर संख्या बनाम स्कोर

प्रतिक्रिया समय (औसत) के अनुसार शीर्ष मॉडल