गलत उत्तर विफलता रैंकिंग

देखें कि किन AI मॉडलों में गलत उत्तर सबसे अधिक होता है, ताकि आप चुनने से पहले भरोसेमंदी के जोखिम समझ सकें।

दिखाए गए मॉडल

कुल विफलताएँ

1585

सबसे अधिक प्रभावित मॉडल

श्रेणियाँ

215/215

रैंक	मॉडल	कंपनी	गलत उत्तर संख्या	स्कोर	कुल लागत	सही परीक्षण	प्रतिक्रिया समय (औसत)
#151	GLM 5V Turbo none	Z.ai	11	5.6	$0.052	8/21	2.99s
कुल टेस्ट 21 गलत टेस्ट 13 कुल लागत $0.052 प्रतिक्रिया समय (औसत) 2.99s
#153	Mimo V2 PRO none	Xiaomi	11	5.6	$0.045	7/21	2.27s
कुल टेस्ट 21 गलत टेस्ट 14 कुल लागत $0.045 प्रतिक्रिया समय (औसत) 2.27s
#155	KAT-Coder-Air V2.5 medium	Kwaipilot	11	5.6	$0.048	8/22	8.42s
कुल टेस्ट 22 गलत टेस्ट 14 कुल लागत $0.048 प्रतिक्रिया समय (औसत) 8.42s
#158	Qwen3.6 27B none	Qwen	11	5.5	$0.087	7/22	10.7s
कुल टेस्ट 22 गलत टेस्ट 15 कुल लागत $0.087 प्रतिक्रिया समय (औसत) 10.7s
#160	MiMo-V2.5-Pro none	Xiaomi	11	5.5	$0.068	6/22	4.12s
कुल टेस्ट 22 गलत टेस्ट 16 कुल लागत $0.068 प्रतिक्रिया समय (औसत) 4.12s
#66	KAT-Coder-Pro V2.5 low	Kwaipilot	10	7.4	$0.387	11/22	19.5s
कुल टेस्ट 22 गलत टेस्ट 11 कुल लागत $0.387 प्रतिक्रिया समय (औसत) 19.5s
#73	KAT-Coder-Pro V2.5 high	Kwaipilot	10	7.2	$0.482	11/22	20.8s
कुल टेस्ट 22 गलत टेस्ट 11 कुल लागत $0.482 प्रतिक्रिया समय (औसत) 20.8s
#75	Qwen3.7 Plus none	Qwen	10	7.2	$0.106	11/22	12.1s
कुल टेस्ट 22 गलत टेस्ट 11 कुल लागत $0.106 प्रतिक्रिया समय (औसत) 12.1s
#87	GPT-5.6 Sol none	OpenAI	10	6.9	$0.524	11/22	2.16s
कुल टेस्ट 22 गलत टेस्ट 11 कुल लागत $0.524 प्रतिक्रिया समय (औसत) 2.16s
#97	KAT-Coder-Pro V2.5 none	Kwaipilot	10	6.7	$0.476	11/22	25.6s
कुल टेस्ट 22 गलत टेस्ट 11 कुल लागत $0.476 प्रतिक्रिया समय (औसत) 25.6s
#103	Qwen3.6 Max Preview none	Qwen	10	6.6	$0.231	12/22	7.82s
कुल टेस्ट 22 गलत टेस्ट 10 कुल लागत $0.231 प्रतिक्रिया समय (औसत) 7.82s
#123	GPT-5.6 Luna low	OpenAI	10	6.2	$0.249	10/22	5.04s
कुल टेस्ट 22 गलत टेस्ट 12 कुल लागत $0.249 प्रतिक्रिया समय (औसत) 5.04s
#152	Owl Alpha medium	Openrouter	10	5.6	$0.000	8/21	11.9s
कुल टेस्ट 21 गलत टेस्ट 13 कुल लागत $0.000 प्रतिक्रिया समय (औसत) 11.9s
#154	Owl Alpha none	Openrouter	10	5.6	$0.000	7/21	9.88s
कुल टेस्ट 21 गलत टेस्ट 14 कुल लागत $0.000 प्रतिक्रिया समय (औसत) 9.88s
#162	Gemma 4 26B A4B none	Google	10	5.5	$0.015	8/22	7.64s
कुल टेस्ट 22 गलत टेस्ट 14 कुल लागत $0.015 प्रतिक्रिया समय (औसत) 7.64s

गलत उत्तर विफलताएँ

मॉडल फ़िल्टर करें

गलत उत्तर संख्या के अनुसार शीर्ष मॉडल

गलत उत्तर संख्या बनाम स्कोर

प्रतिक्रिया समय (औसत) के अनुसार शीर्ष मॉडल