AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

AI BENCHY अपयशे

चुकीचे उत्तर अपयशे

कोणत्या AI मॉडेल्सना चुकीचे उत्तर सर्वाधिक वेळा येतो ते पाहा, म्हणजे निवडण्यापूर्वी विश्वासार्हतेचे धोके लक्षात येतील. क्रम लावा: प्रतिसाद वेळ (सरासरी) ↓.

दाखवलेली मॉडेल्स

15

एकूण अपयशे

1204

सर्वाधिक प्रभावित मॉडेल

Kimi K2.5 5
क्रमांक मॉडेल कंपनी चुकीचे उत्तर संख्या स्कोअर बरोबर चाचण्या प्रतिसाद वेळ (सरासरी)
#80 Mimo V2 Omni medium Xiaomi 5 6.7 10/21 41.2s
#119 Cobuddy medium Baidu 9 5.6 7/21 39.9s
#83 Step 3.5 Flash none Stepfun 1 6.6 6/12 39.0s
#18 Qwen3.7 Plus medium Qwen 5 8.2 15/21 38.9s
#130 MiniMax M2.7 medium Minimax 6 5.3 5/21 38.2s
#9 GPT-5.5 medium OpenAI 4 8.8 17/21 38.0s
#158 GLM 4.7 Flash medium Z.ai 9 4.4 4/21 35.1s
#55 GLM 5.1 medium Z.ai 4 7.3 12/21 33.7s
#17 GLM 5 medium Z.ai 3 8.3 15/21 33.5s
#105 Nemotron 3 Super medium NVIDIA 5 5.8 8/21 32.0s
#26 Qwen3.6 Plus medium Qwen 5 7.9 14/21 30.7s
#100 Grok Build 0.1 none X AI 7 6.0 7/19 28.7s
#65 Grok 4.20 medium X AI 6 7.1 12/21 27.7s
#56 MiMo-V2.5 medium Xiaomi 5 7.3 12/21 27.1s
#139 DeepSeek V4 Flash none DeepSeek 12 5.0 5/21 26.8s

चुकीचे उत्तर संख्या नुसार शीर्ष मॉडेल्स

चुकीचे उत्तर संख्या वि स्कोअर

प्रतिसाद वेळ (सरासरी) नुसार शीर्ष मॉडेल्स