गलत उत्तर विफलता रैंकिंग

देखें कि किन AI मॉडलों में गलत उत्तर सबसे अधिक होता है, ताकि आप चुनने से पहले भरोसेमंदी के जोखिम समझ सकें। क्रमबद्ध करें: सही परीक्षण ↓.

दिखाए गए मॉडल

कुल विफलताएँ

1585

सबसे अधिक प्रभावित मॉडल

Gemini 3.6 Flash 1

श्रेणियाँ

215/215

रैंक	मॉडल	कंपनी	गलत उत्तर संख्या	स्कोर	कुल लागत	सही परीक्षण	प्रतिक्रिया समय (औसत)
#115	Mimo V2 PRO medium	Xiaomi	5	6.3	$0.333	12/21	22.2s
कुल टेस्ट 21 गलत टेस्ट 9 कुल लागत $0.333 प्रतिक्रिया समय (औसत) 22.2s
#119	MiMo-V2-Flash medium	Xiaomi	5	6.3	$0.043	12/21	20.1s
कुल टेस्ट 21 गलत टेस्ट 9 कुल लागत $0.043 प्रतिक्रिया समय (औसत) 20.1s
#149	Gemini 3.1 Flash Lite high	Google	4	5.6	$2.044	10/18	62.0s
कुल टेस्ट 18 गलत टेस्ट 8 कुल लागत $2.044 प्रतिक्रिया समय (औसत) 62.0s
#29	GPT-5 Mini medium	OpenAI	5	8.1	$0.237	12/22	27.6s
कुल टेस्ट 22 गलत टेस्ट 10 कुल लागत $0.237 प्रतिक्रिया समय (औसत) 27.6s
#30	Muse Spark 1.1 high	Meta	4	8.1	$1.694	12/22	31.5s
कुल टेस्ट 22 गलत टेस्ट 10 कुल लागत $1.694 प्रतिक्रिया समय (औसत) 31.5s
#51	MiniMax M3 medium	Minimax	3	7.6	$0.286	12/22	75.0s
कुल टेस्ट 22 गलत टेस्ट 10 कुल लागत $0.286 प्रतिक्रिया समय (औसत) 75.0s
#56	Kimi K2.7 Code medium	Moonshot AI	5	7.5	$0.740	12/22	84.2s
कुल टेस्ट 22 गलत टेस्ट 10 कुल लागत $0.740 प्रतिक्रिया समय (औसत) 84.2s
#57	GPT-5.4 Nano medium	OpenAI	8	7.5	$0.138	12/22	13.2s
कुल टेस्ट 22 गलत टेस्ट 10 कुल लागत $0.138 प्रतिक्रिया समय (औसत) 13.2s
#60	GPT-5.4 Mini medium	OpenAI	6	7.5	$0.756	12/22	25.9s
कुल टेस्ट 22 गलत टेस्ट 10 कुल लागत $0.756 प्रतिक्रिया समय (औसत) 25.9s
#64	LongCat 2.0 medium	Meituan	7	7.4	$0.478	12/22	136.6s
कुल टेस्ट 22 गलत टेस्ट 10 कुल लागत $0.478 प्रतिक्रिया समय (औसत) 136.6s
#67	Claude Sonnet 4.6 none	Anthropic	5	7.3	$0.661	12/22	8.12s
कुल टेस्ट 22 गलत टेस्ट 10 कुल लागत $0.661 प्रतिक्रिया समय (औसत) 8.12s
#71	Step 3.7 Flash low	Stepfun	8	7.3	$0.454	12/22	20.7s
कुल टेस्ट 22 गलत टेस्ट 10 कुल लागत $0.454 प्रतिक्रिया समय (औसत) 20.7s
#72	Kimi K2.6 medium	Moonshot AI	3	7.2	$1.036	12/22	110.0s
कुल टेस्ट 22 गलत टेस्ट 10 कुल लागत $1.036 प्रतिक्रिया समय (औसत) 110.0s
#79	Grok 4.20 medium	X AI	6	7.1	$0.777	12/22	29.5s
कुल टेस्ट 22 गलत टेस्ट 10 कुल लागत $0.777 प्रतिक्रिया समय (औसत) 29.5s
#88	MiMo-V2.5-Pro medium	Xiaomi	3	6.9	$0.187	12/22	33.9s
कुल टेस्ट 22 गलत टेस्ट 10 कुल लागत $0.187 प्रतिक्रिया समय (औसत) 33.9s

गलत उत्तर विफलताएँ

मॉडल फ़िल्टर करें

गलत उत्तर संख्या के अनुसार शीर्ष मॉडल

गलत उत्तर संख्या बनाम स्कोर

प्रतिक्रिया समय (औसत) के अनुसार शीर्ष मॉडल