AI BENCHY
Advertise here

AI BENCHY अपयशे

चुकीचे उत्तर अपयशे

कोणत्या AI मॉडेल्सना चुकीचे उत्तर सर्वाधिक वेळा येतो ते पाहा, म्हणजे निवडण्यापूर्वी विश्वासार्हतेचे धोके लक्षात येतील. क्रम लावा: प्रतिसाद वेळ (सरासरी) ↑.

दाखवलेली मॉडेल्स

15

एकूण अपयशे

1204

सर्वाधिक प्रभावित मॉडेल

Mistral Small 4 15
क्रमांक मॉडेल कंपनी चुकीचे उत्तर संख्या स्कोअर बरोबर चाचण्या प्रतिसाद वेळ (सरासरी)
#65 Grok 4.20 medium X AI 6 7.1 12/21 27.7s
#100 Grok Build 0.1 none X AI 7 6.0 7/19 28.7s
#26 Qwen3.6 Plus medium Qwen 5 7.9 14/21 30.7s
#105 Nemotron 3 Super medium NVIDIA 5 5.8 8/21 32.0s
#17 GLM 5 medium Z.ai 3 8.3 15/21 33.5s
#55 GLM 5.1 medium Z.ai 4 7.3 12/21 33.7s
#158 GLM 4.7 Flash medium Z.ai 9 4.4 4/21 35.1s
#9 GPT-5.5 medium OpenAI 4 8.8 17/21 38.0s
#130 MiniMax M2.7 medium Minimax 6 5.3 5/21 38.2s
#18 Qwen3.7 Plus medium Qwen 5 8.2 15/21 38.9s
#83 Step 3.5 Flash none Stepfun 1 6.6 6/12 39.0s
#119 Cobuddy medium Baidu 9 5.6 7/21 39.9s
#80 Mimo V2 Omni medium Xiaomi 5 6.7 10/21 41.2s
#29 Qwen3.5-122B-A10B medium Qwen 5 7.8 14/21 42.5s
#94 GPT-5 Nano medium OpenAI 9 6.3 9/21 42.5s

चुकीचे उत्तर संख्या नुसार शीर्ष मॉडेल्स

चुकीचे उत्तर संख्या वि स्कोअर

प्रतिसाद वेळ (सरासरी) नुसार शीर्ष मॉडेल्स