AI BENCHY
Advertise here

AI BENCHY अपयशे

चुकीचे उत्तर अपयशे

कोणत्या AI मॉडेल्सना चुकीचे उत्तर सर्वाधिक वेळा येतो ते पाहा, म्हणजे निवडण्यापूर्वी विश्वासार्हतेचे धोके लक्षात येतील. क्रम लावा: अपयशांची संख्या ↑.

दाखवलेली मॉडेल्स

15

एकूण अपयशे

1204

सर्वाधिक प्रभावित मॉडेल

Gemini 3 Flash Preview 1
क्रमांक मॉडेल कंपनी चुकीचे उत्तर संख्या स्कोअर बरोबर चाचण्या प्रतिसाद वेळ (सरासरी)
#119 Cobuddy medium Baidu 9 5.6 7/21 39.9s
#136 Elephant Alpha medium Openrouter 9 5.1 6/21 1.27s
#137 Elephant Alpha none Openrouter 9 5.1 5/21 1.22s
#138 Ling-2.6-flash none Inclusionai 9 5.0 6/21 9.34s
#158 GLM 4.7 Flash medium Z.ai 9 4.4 4/21 35.1s
#160 LFM2-24B-A2B none Liquid 9 4.2 2/16 782ms
#162 Nemotron 3 Nano Omni 30b A3b Reasoning none NVIDIA 9 4.1 2/19 728ms
#74 Qwen3.6 Max Preview none Qwen 10 6.9 11/21 3.30s
#88 Qwen3.7 Plus none Qwen 10 6.4 10/21 2.85s
#101 Mimo V2 Omni none Xiaomi 10 6.0 8/21 2.44s
#102 Gemma 4 26B A4B none Google 10 6.0 8/21 5.91s
#106 Grok 4.20 Beta none X AI 10 5.8 6/18 1.19s
#111 Owl Alpha medium Openrouter 10 5.7 8/21 11.9s
#113 DeepSeek V4 Pro none DeepSeek 10 5.7 7/21 12.4s
#121 Owl Alpha none Openrouter 10 5.5 7/21 9.88s

चुकीचे उत्तर संख्या नुसार शीर्ष मॉडेल्स

चुकीचे उत्तर संख्या वि स्कोअर

प्रतिसाद वेळ (सरासरी) नुसार शीर्ष मॉडेल्स