कोडिंग x गलत उत्तर रैंकिंग

AI BENCHY श्रेणी विफलताएँ

देखें कि कोडिंग में किन AI मॉडलों में गलत उत्तर आने की सबसे अधिक संभावना है, ताकि आप कमजोरियाँ जल्दी पहचान सकें। क्रमबद्ध करें: सही परीक्षण ↓.

दिखाए गए मॉडल

कुल विफलताएँ

230

सबसे अधिक प्रभावित मॉडल

Gemini 3 Flash Preview 1

विफलता के कारण

गलत उत्तर230 API त्रुटि43 समय समाप्त23 कोई उत्तर नहीं18 निर्देशों का पालन नहीं किया16 अतिरिक्त फॉर्मेटिंग12

श्रेणियाँ

डोमेन-विशिष्ट367 एंटी-एआई ट्रिक्स270 कोडिंग230 पहेली समाधान172 सामान्य ज्ञान149 संयुक्त58 निर्देश पालन56 Samanya Buddhimatta49 डेटा पार्सिंग और निष्कर्षण36 टूल कॉलिंग3

134/134

रैंक	मॉडल	कंपनी	गलत उत्तर संख्या	श्रेणी स्कोर	कुल लागत	सही परीक्षण	प्रतिक्रिया समय (औसत)
#2	Gemini 3 Flash Preview medium	Google	1	8.6	$0.667	2/3	84.4s
कुल टेस्ट 3 गलत टेस्ट 1 कुल लागत $0.667 प्रतिक्रिया समय (औसत) 84.4s
#8	Gemini 3.5 Flash low	Google	1	7.8	$0.349	2/3	6.71s
कुल टेस्ट 3 गलत टेस्ट 1 कुल लागत $0.349 प्रतिक्रिया समय (औसत) 6.71s
#10	Gemini 3.1 Pro Preview medium	Google	1	7.9	$1.054	2/3	40.2s
कुल टेस्ट 3 गलत टेस्ट 1 कुल लागत $1.054 प्रतिक्रिया समय (औसत) 40.2s
#12	GPT-5.5 medium	OpenAI	1	8.8	$3.679	2/3	59.8s
कुल टेस्ट 3 गलत टेस्ट 1 कुल लागत $3.679 प्रतिक्रिया समय (औसत) 59.8s
#14	Qwen3.6 Max Preview medium	Qwen	1	8.8	$0.960	2/3	146.5s
कुल टेस्ट 3 गलत टेस्ट 1 कुल लागत $0.960 प्रतिक्रिया समय (औसत) 146.5s
#16	Claude Opus 4.7 medium	Anthropic	1	7.6	$0.679	2/3	13.0s
कुल टेस्ट 3 गलत टेस्ट 1 कुल लागत $0.679 प्रतिक्रिया समय (औसत) 13.0s
#17	GLM 5.2 medium	Z.ai	1	8.2	$0.129	2/3	41.0s
कुल टेस्ट 3 गलत टेस्ट 1 कुल लागत $0.129 प्रतिक्रिया समय (औसत) 41.0s
#20	GPT-5.4 medium	OpenAI	1	8.8	$1.210	2/3	44.4s
कुल टेस्ट 3 गलत टेस्ट 1 कुल लागत $1.210 प्रतिक्रिया समय (औसत) 44.4s
#21	Seed-2.0-Lite medium	Bytedance Seed	1	8.0	$0.175	2/3	156.7s
कुल टेस्ट 3 गलत टेस्ट 1 कुल लागत $0.175 प्रतिक्रिया समय (औसत) 156.7s
#22	GPT-5.2 Chat none	OpenAI	1	8.8	$0.393	2/3	9.82s
कुल टेस्ट 3 गलत टेस्ट 1 कुल लागत $0.393 प्रतिक्रिया समय (औसत) 9.82s
#23	Step 3.7 Flash medium	Stepfun	1	8.8	$0.376	2/3	27.4s
कुल टेस्ट 3 गलत टेस्ट 1 कुल लागत $0.376 प्रतिक्रिया समय (औसत) 27.4s
#26	Grok 4.5 medium	X AI	1	7.6	$1.696	2/3	155.7s
कुल टेस्ट 3 गलत टेस्ट 1 कुल लागत $1.696 प्रतिक्रिया समय (औसत) 155.7s
#27	DeepSeek V4 Flash high	DeepSeek	1	7.8	$0.027	2/3	50.6s
कुल टेस्ट 3 गलत टेस्ट 1 कुल लागत $0.027 प्रतिक्रिया समय (औसत) 50.6s
#28	Gemini 2.5 Flash medium	Google	1	7.8	$0.379	2/3	41.0s
कुल टेस्ट 3 गलत टेस्ट 1 कुल लागत $0.379 प्रतिक्रिया समय (औसत) 41.0s
#29	GPT-5.6 Terra high	OpenAI	1	7.6	$0.852	2/3	9.14s
कुल टेस्ट 3 गलत टेस्ट 1 कुल लागत $0.852 प्रतिक्रिया समय (औसत) 9.14s

मॉडल फ़िल्टर करें

गलत उत्तर संख्या के अनुसार शीर्ष मॉडल

गलत उत्तर संख्या बनाम स्कोर

प्रतिक्रिया समय (औसत) के अनुसार शीर्ष मॉडल

अनुमानित व्यर्थ लागत के अनुसार शीर्ष मॉडल

कोडिंग: गलत उत्तर

मॉडल फ़िल्टर करें

गलत उत्तर संख्या के अनुसार शीर्ष मॉडल

गलत उत्तर संख्या बनाम स्कोर

प्रतिक्रिया समय (औसत) के अनुसार शीर्ष मॉडल

अनुमानित व्यर्थ लागत के अनुसार शीर्ष मॉडल