चुकीचे उत्तर अपयश क्रमवारी

कोणत्या AI मॉडेल्सना चुकीचे उत्तर सर्वाधिक वेळा येतो ते पाहा, म्हणजे निवडण्यापूर्वी विश्वासार्हतेचे धोके लक्षात येतील. क्रम लावा: अपयशांची संख्या ↑.

दाखवलेली मॉडेल्स

एकूण अपयशे

1558

सर्वाधिक प्रभावित मॉडेल

Gemini 3 Flash Preview 1

श्रेणी

209/209

क्रमांक	मॉडेल	कंपनी	चुकीचे उत्तर संख्या	स्कोअर	एकूण खर्च	बरोबर चाचण्या	प्रतिसाद वेळ (सरासरी)
#14	Claude Opus 4.8 medium	Anthropic	3	8.8	$1.931	18/22	12.5s
एकूण चाचण्या 22 चुकीच्या चाचण्या 4 एकूण खर्च $1.931 प्रतिसाद वेळ (सरासरी) 12.5s
#15	Claude Opus 4.7 medium	Anthropic	3	8.7	$1.477	18/22	7.61s
एकूण चाचण्या 22 चुकीच्या चाचण्या 4 एकूण खर्च $1.477 प्रतिसाद वेळ (सरासरी) 7.61s
#21	GPT-5.2 medium	OpenAI	3	8.4	$0.951	14/22	22.6s
एकूण चाचण्या 22 चुकीच्या चाचण्या 8 एकूण खर्च $0.951 प्रतिसाद वेळ (सरासरी) 22.6s
#31	GLM 5.2 high	Z.ai	3	8.0	$0.970	14/22	62.7s
एकूण चाचण्या 22 चुकीच्या चाचण्या 8 एकूण खर्च $0.970 प्रतिसाद वेळ (सरासरी) 62.7s
#38	GLM 5.2 medium	Z.ai	3	7.8	$0.222	15/21	23.3s
एकूण चाचण्या 21 चुकीच्या चाचण्या 6 एकूण खर्च $0.222 प्रतिसाद वेळ (सरासरी) 23.3s
#42	GLM 5 medium	Z.ai	3	7.7	$0.307	15/21	33.5s
एकूण चाचण्या 21 चुकीच्या चाचण्या 6 एकूण खर्च $0.307 प्रतिसाद वेळ (सरासरी) 33.5s
#43	Claude Opus 4.6 medium	Anthropic	3	7.7	$3.059	13/22	34.3s
एकूण चाचण्या 22 चुकीच्या चाचण्या 9 एकूण खर्च $3.059 प्रतिसाद वेळ (सरासरी) 34.3s
#47	MiniMax M3 medium	Minimax	3	7.6	$0.286	12/22	75.0s
एकूण चाचण्या 22 चुकीच्या चाचण्या 10 एकूण खर्च $0.286 प्रतिसाद वेळ (सरासरी) 75.0s
#68	Kimi K2.6 medium	Moonshot AI	3	7.2	$1.036	12/22	110.0s
एकूण चाचण्या 22 चुकीच्या चाचण्या 10 एकूण खर्च $1.036 प्रतिसाद वेळ (सरासरी) 110.0s
#79	Gemini 3.5 Flash none	Google	3	7.0	$1.079	15/22	9.93s
एकूण चाचण्या 22 चुकीच्या चाचण्या 7 एकूण खर्च $1.079 प्रतिसाद वेळ (सरासरी) 9.93s
#84	MiMo-V2.5-Pro medium	Xiaomi	3	6.9	$0.187	12/22	33.9s
एकूण चाचण्या 22 चुकीच्या चाचण्या 10 एकूण खर्च $0.187 प्रतिसाद वेळ (सरासरी) 33.9s
#94	Claude Opus 4.7 none	Anthropic	3	6.6	$0.505	16/19	3.02s
एकूण चाचण्या 19 चुकीच्या चाचण्या 3 एकूण खर्च $0.505 प्रतिसाद वेळ (सरासरी) 3.02s
#95	Gemma 4 26B A4B medium	Google	3	6.6	$0.089	14/22	103.8s
एकूण चाचण्या 22 चुकीच्या चाचण्या 8 एकूण खर्च $0.089 प्रतिसाद वेळ (सरासरी) 103.8s
#100	Hy3 preview medium	Tencent	3	6.5	$0.018	14/21	16.3s
एकूण चाचण्या 21 चुकीच्या चाचण्या 7 एकूण खर्च $0.018 प्रतिसाद वेळ (सरासरी) 16.3s
#131	Grok 4.20 Beta medium	X AI	3	6.0	$0.750	14/18	9.75s
एकूण चाचण्या 18 चुकीच्या चाचण्या 4 एकूण खर्च $0.750 प्रतिसाद वेळ (सरासरी) 9.75s

चुकीचे उत्तर अपयशे

मॉडेल फिल्टर करा

चुकीचे उत्तर संख्या नुसार शीर्ष मॉडेल्स

चुकीचे उत्तर संख्या वि स्कोअर

प्रतिसाद वेळ (सरासरी) नुसार शीर्ष मॉडेल्स