गलत उत्तर विफलता रैंकिंग

देखें कि किन AI मॉडलों में गलत उत्तर सबसे अधिक होता है, ताकि आप चुनने से पहले भरोसेमंदी के जोखिम समझ सकें। क्रमबद्ध करें: सही परीक्षण ↑.

दिखाए गए मॉडल

कुल विफलताएँ

1585

सबसे अधिक प्रभावित मॉडल

Granite 4.1 8B 13

श्रेणियाँ

215/215

रैंक	मॉडल	कंपनी	गलत उत्तर संख्या	स्कोर	कुल लागत	सही परीक्षण	प्रतिक्रिया समय (औसत)
#206	MiMo-V2-Flash none	Xiaomi	13	4.0	$0.025	4/21	2.76s
कुल टेस्ट 21 गलत टेस्ट 17 कुल लागत $0.025 प्रतिक्रिया समय (औसत) 2.76s
#198	Laguna M.1 none	Poolside	10	4.4	$0.009	4/19	2.89s
कुल टेस्ट 19 गलत टेस्ट 15 कुल लागत $0.009 प्रतिक्रिया समय (औसत) 2.89s
#213	Nemotron 3 Nano Omni 30b A3b Reasoning medium	NVIDIA	7	3.4	$0.000	4/19	17.1s
कुल टेस्ट 19 गलत टेस्ट 15 कुल लागत $0.000 प्रतिक्रिया समय (औसत) 17.1s
#156	DeepSeek V4 Flash none	DeepSeek	12	5.6	$0.042	5/22	36.8s
कुल टेस्ट 22 गलत टेस्ट 17 कुल लागत $0.042 प्रतिक्रिया समय (औसत) 36.8s
#166	Laguna XS 2.1 none	Poolside	14	5.3	$0.008	5/22	1.55s
कुल टेस्ट 22 गलत टेस्ट 17 कुल लागत $0.008 प्रतिक्रिया समय (औसत) 1.55s
#171	Mistral Small 4 none	Mistral	16	5.1	$0.022	5/22	1.20s
कुल टेस्ट 22 गलत टेस्ट 17 कुल लागत $0.022 प्रतिक्रिया समय (औसत) 1.20s
#172	Qwen3 Coder Next none	Qwen	14	5.1	$0.025	5/22	9.12s
कुल टेस्ट 22 गलत टेस्ट 17 कुल लागत $0.025 प्रतिक्रिया समय (औसत) 9.12s
#173	Mistral Small 4 medium	Mistral	12	5.1	$0.096	5/22	10.8s
कुल टेस्ट 22 गलत टेस्ट 17 कुल लागत $0.096 प्रतिक्रिया समय (औसत) 10.8s
#174	MiMo-V2.5 none	Xiaomi	14	5.1	$0.025	5/22	4.62s
कुल टेस्ट 22 गलत टेस्ट 17 कुल लागत $0.025 प्रतिक्रिया समय (औसत) 4.62s
#178	MiniMax M2.7 medium	Minimax	6	5.0	$0.163	5/22	41.3s
कुल टेस्ट 22 गलत टेस्ट 17 कुल लागत $0.163 प्रतिक्रिया समय (औसत) 41.3s
#180	GPT-4o-mini none	OpenAI	15	5.0	$0.010	5/22	1.99s
कुल टेस्ट 22 गलत टेस्ट 17 कुल लागत $0.010 प्रतिक्रिया समय (औसत) 1.99s
#183	Nemotron 3 Super none	NVIDIA	15	4.9	$0.008	5/22	5.97s
कुल टेस्ट 22 गलत टेस्ट 17 कुल लागत $0.008 प्रतिक्रिया समय (औसत) 5.97s
#188	KAT-Coder-Air V2.5 none	Kwaipilot	13	4.8	$0.067	5/22	12.2s
कुल टेस्ट 22 गलत टेस्ट 17 कुल लागत $0.067 प्रतिक्रिया समय (औसत) 12.2s
#196	MiniMax M2.5 medium	Minimax	7	4.6	$0.340	5/22	68.3s
कुल टेस्ट 22 गलत टेस्ट 17 कुल लागत $0.340 प्रतिक्रिया समय (औसत) 68.3s
#199	Elephant Alpha none	Openrouter	9	4.3	$0.000	5/21	1.22s
कुल टेस्ट 21 गलत टेस्ट 16 कुल लागत $0.000 प्रतिक्रिया समय (औसत) 1.22s

गलत उत्तर विफलताएँ

मॉडल फ़िल्टर करें

गलत उत्तर संख्या के अनुसार शीर्ष मॉडल

गलत उत्तर संख्या बनाम स्कोर

प्रतिक्रिया समय (औसत) के अनुसार शीर्ष मॉडल