कोडिंग मॉडल रैंकिंग

AI BENCHY श्रेणी

देखें कि कोडिंग में कौन से AI मॉडल सबसे अच्छा प्रदर्शन करते हैं, कौन से भरोसेमंद बने रहते हैं और सबसे बड़े अंतर कहाँ दिखाई देते हैं। क्रमबद्ध करें: प्रतिक्रिया समय (औसत) ↑.

दिखाए गए मॉडल

औसत कोडिंग स्कोर

5.7

सर्वश्रेष्ठ मॉडल

Gemini 3 PRO Preview 3.0

विफलता के कारण

विफलता कारण गलत उत्तर के साथ230 विफलता कारण API त्रुटि के साथ43 विफलता कारण समय समाप्त के साथ25 विफलता कारण कोई उत्तर नहीं के साथ18 विफलता कारण निर्देशों का पालन नहीं किया के साथ16 विफलता कारण अतिरिक्त फॉर्मेटिंग के साथ12

189/189

रैंक	मॉडल	कंपनी	कोडिंग स्कोर	स्कोर	कुल लागत	सही परीक्षण	प्रतिक्रिया समय (औसत)
#74	GLM 5.2 none	Z.ai	3.7	7.1	$0.042	0/3	7.55s
कुल टेस्ट 3 गलत टेस्ट 3 कुल लागत $0.042 प्रतिक्रिया समय (औसत) 7.55s
#46	Claude Opus 4.8 low	Anthropic	6.6	7.7	$1.270	1/3	7.58s
कुल टेस्ट 3 गलत टेस्ट 2 कुल लागत $1.270 प्रतिक्रिया समय (औसत) 7.58s
#148	Qwen3.6 35B A3B none	Qwen	5.5	5.2	$0.031	1/3	8.77s
कुल टेस्ट 3 गलत टेस्ट 2 कुल लागत $0.031 प्रतिक्रिया समय (औसत) 8.77s
#29	GPT-5.6 Terra high	OpenAI	7.6	8.2	$0.852	2/3	9.14s
कुल टेस्ट 3 गलत टेस्ट 1 कुल लागत $0.852 प्रतिक्रिया समय (औसत) 9.14s
#5	GPT-5.6 Sol medium	OpenAI	10.0	9.4	$0.966	3/3	9.40s
कुल टेस्ट 3 गलत टेस्ट 0 कुल लागत $0.966 प्रतिक्रिया समय (औसत) 9.40s
#50	Step 3.7 Flash low	Stepfun	8.2	7.7	$0.341	2/3	9.46s
कुल टेस्ट 3 गलत टेस्ट 1 कुल लागत $0.341 प्रतिक्रिया समय (औसत) 9.46s
#48	GPT-5.6 Terra low	OpenAI	6.6	7.7	$0.343	1/3	9.56s
कुल टेस्ट 3 गलत टेस्ट 2 कुल लागत $0.343 प्रतिक्रिया समय (औसत) 9.56s
#184	gpt-oss-120b none	OpenAI	1.5	4.0	$0.010	0/1	9.57s
कुल टेस्ट 1 गलत टेस्ट 1 कुल लागत $0.010 प्रतिक्रिया समय (औसत) 9.57s
#22	GPT-5.2 Chat none	OpenAI	8.8	8.5	$0.393	2/3	9.82s
कुल टेस्ट 3 गलत टेस्ट 1 कुल लागत $0.393 प्रतिक्रिया समय (औसत) 9.82s
#55	GPT-5.6 Luna medium	OpenAI	5.4	7.6	$0.258	1/3	10.4s
कुल टेस्ट 3 गलत टेस्ट 2 कुल लागत $0.258 प्रतिक्रिया समय (औसत) 10.4s
#58	GPT-5.3 Chat none	OpenAI	5.6	7.5	$0.433	1/3	10.5s
कुल टेस्ट 3 गलत टेस्ट 2 कुल लागत $0.433 प्रतिक्रिया समय (औसत) 10.5s
#167	Ling-2.6-1T none	Inclusionai	3.8	4.7	$0.005	0/3	10.6s
कुल टेस्ट 3 गलत टेस्ट 3 कुल लागत $0.005 प्रतिक्रिया समय (औसत) 10.6s
#75	MiMo-V2-Flash medium	Xiaomi	6.0	7.1	$0.043	1/3	10.7s
कुल टेस्ट 3 गलत टेस्ट 2 कुल लागत $0.043 प्रतिक्रिया समय (औसत) 10.7s
#114	Gemma 4 31B none	Google	5.5	6.1	$0.004	1/3	11.2s
कुल टेस्ट 3 गलत टेस्ट 2 कुल लागत $0.004 प्रतिक्रिया समय (औसत) 11.2s
#163	Ling-2.6-flash none	Inclusionai	5.3	4.9	$0.001	1/3	11.2s
कुल टेस्ट 3 गलत टेस्ट 2 कुल लागत $0.001 प्रतिक्रिया समय (औसत) 11.2s

कोडिंग रैंकिंग

मॉडल फ़िल्टर करें

कोडिंग स्कोर के अनुसार शीर्ष मॉडल

कोडिंग स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत) के अनुसार शीर्ष मॉडल