गलत उत्तर विफलता रैंकिंग

देखें कि किन AI मॉडलों में गलत उत्तर सबसे अधिक होता है, ताकि आप चुनने से पहले भरोसेमंदी के जोखिम समझ सकें।

दिखाए गए मॉडल

कुल विफलताएँ

1558

सबसे अधिक प्रभावित मॉडल

श्रेणियाँ

209/209

रैंक	मॉडल	कंपनी	गलत उत्तर संख्या	स्कोर	कुल लागत	सही परीक्षण	प्रतिक्रिया समय (औसत)
#124	Qwen3.6 Flash none	Qwen	12	6.1	$0.062	7/22	3.74s
कुल टेस्ट 22 गलत टेस्ट 15 कुल लागत $0.062 प्रतिक्रिया समय (औसत) 3.74s
#126	Qwen3.5 Plus 2026-04-20 none	Qwen	12	6.1	$0.122	8/22	13.6s
कुल टेस्ट 22 गलत टेस्ट 14 कुल लागत $0.122 प्रतिक्रिया समय (औसत) 13.6s
#127	Qwen3.5-35B-A3B none	Qwen	12	6.1	$0.106	7/22	12.7s
कुल टेस्ट 22 गलत टेस्ट 15 कुल लागत $0.106 प्रतिक्रिया समय (औसत) 12.7s
#129	Nemotron 3 Ultra none	NVIDIA	12	6.1	$0.095	8/22	3.87s
कुल टेस्ट 22 गलत टेस्ट 14 कुल लागत $0.095 प्रतिक्रिया समय (औसत) 3.87s
#141	GLM 5 none	Z.ai	12	5.7	$0.041	9/21	4.03s
कुल टेस्ट 21 गलत टेस्ट 12 कुल लागत $0.041 प्रतिक्रिया समय (औसत) 4.03s
#150	DeepSeek V4 Flash none	DeepSeek	12	5.6	$0.044	5/22	36.8s
कुल टेस्ट 22 गलत टेस्ट 17 कुल लागत $0.044 प्रतिक्रिया समय (औसत) 36.8s
#162	Ling-2.6-1T none	Inclusionai	12	5.3	$0.016	4/22	8.58s
कुल टेस्ट 22 गलत टेस्ट 18 कुल लागत $0.016 प्रतिक्रिया समय (औसत) 8.58s
#167	Mistral Small 4 medium	Mistral	12	5.1	$0.096	5/22	10.8s
कुल टेस्ट 22 गलत टेस्ट 17 कुल लागत $0.096 प्रतिक्रिया समय (औसत) 10.8s
#171	North Mini Code none	Cohere	12	5.1	$0.000	4/22	29.9s
कुल टेस्ट 22 गलत टेस्ट 18 कुल लागत $0.000 प्रतिक्रिया समय (औसत) 29.9s
#183	Trinity Large Preview none	Arcee AI	12	4.8	$0.008	4/21	2.98s
कुल टेस्ट 21 गलत टेस्ट 17 कुल लागत $0.008 प्रतिक्रिया समय (औसत) 2.98s
#87	GPT-5.5 none	OpenAI	11	6.9	$0.544	11/22	2.36s
कुल टेस्ट 22 गलत टेस्ट 11 कुल लागत $0.544 प्रतिक्रिया समय (औसत) 2.36s
#102	Laguna XS 2.1 medium	Poolside	11	6.5	$0.068	9/22	47.9s
कुल टेस्ट 22 गलत टेस्ट 13 कुल लागत $0.068 प्रतिक्रिया समय (औसत) 47.9s
#122	Gemini 3.1 Flash Lite none	Google	11	6.1	$0.046	9/22	1.75s
कुल टेस्ट 22 गलत टेस्ट 13 कुल लागत $0.046 प्रतिक्रिया समय (औसत) 1.75s
#132	GPT-5.6 Terra none	OpenAI	11	6.0	$0.349	8/22	1.65s
कुल टेस्ट 22 गलत टेस्ट 14 कुल लागत $0.349 प्रतिक्रिया समय (औसत) 1.65s
#138	Kimi K2.6 none	Moonshot AI	11	5.8	$0.184	7/22	19.6s
कुल टेस्ट 22 गलत टेस्ट 15 कुल लागत $0.184 प्रतिक्रिया समय (औसत) 19.6s

गलत उत्तर विफलताएँ

मॉडल फ़िल्टर करें

गलत उत्तर संख्या के अनुसार शीर्ष मॉडल

गलत उत्तर संख्या बनाम स्कोर

प्रतिक्रिया समय (औसत) के अनुसार शीर्ष मॉडल