कोडिंग मॉडल रैंकिंग

AI BENCHY श्रेणी

देखें कि कोडिंग में कौन से AI मॉडल सबसे अच्छा प्रदर्शन करते हैं, कौन से भरोसेमंद बने रहते हैं और सबसे बड़े अंतर कहाँ दिखाई देते हैं। क्रमबद्ध करें: सही परीक्षण ↓.

दिखाए गए मॉडल

औसत कोडिंग स्कोर

5.7

सर्वश्रेष्ठ मॉडल

Gemini 3.5 Flash 10.0

विफलता के कारण

विफलता कारण गलत उत्तर के साथ230 विफलता कारण API त्रुटि के साथ43 विफलता कारण समय समाप्त के साथ25 विफलता कारण कोई उत्तर नहीं के साथ18 विफलता कारण निर्देशों का पालन नहीं किया के साथ16 विफलता कारण अतिरिक्त फॉर्मेटिंग के साथ12

189/189

रैंक	मॉडल	कंपनी	कोडिंग स्कोर	स्कोर	कुल लागत	सही परीक्षण	प्रतिक्रिया समय (औसत)
#23	Step 3.7 Flash medium	Stepfun	8.8	8.5	$0.376	2/3	27.4s
कुल टेस्ट 3 गलत टेस्ट 1 कुल लागत $0.376 प्रतिक्रिया समय (औसत) 27.4s
#24	GLM 5 Turbo medium	Z.ai	8.2	8.4	$0.323	2/3	45.9s
कुल टेस्ट 3 गलत टेस्ट 1 कुल लागत $0.323 प्रतिक्रिया समय (औसत) 45.9s
#26	Grok 4.5 medium	X AI	7.6	8.3	$1.696	2/3	155.7s
कुल टेस्ट 3 गलत टेस्ट 1 कुल लागत $1.696 प्रतिक्रिया समय (औसत) 155.7s
#27	DeepSeek V4 Flash high	DeepSeek	7.8	8.3	$0.027	2/3	50.6s
कुल टेस्ट 3 गलत टेस्ट 1 कुल लागत $0.027 प्रतिक्रिया समय (औसत) 50.6s
#28	Gemini 2.5 Flash medium	Google	7.8	8.2	$0.379	2/3	41.0s
कुल टेस्ट 3 गलत टेस्ट 1 कुल लागत $0.379 प्रतिक्रिया समय (औसत) 41.0s
#29	GPT-5.6 Terra high	OpenAI	7.6	8.2	$0.852	2/3	9.14s
कुल टेस्ट 3 गलत टेस्ट 1 कुल लागत $0.852 प्रतिक्रिया समय (औसत) 9.14s
#31	Nemotron 3 Ultra 550b A55b medium	NVIDIA	8.4	8.1	$0.158	2/3	26.5s
कुल टेस्ट 3 गलत टेस्ट 1 कुल लागत $0.158 प्रतिक्रिया समय (औसत) 26.5s
#33	GPT-5.4 Mini medium	OpenAI	8.4	8.0	$0.526	2/3	57.9s
कुल टेस्ट 3 गलत टेस्ट 1 कुल लागत $0.526 प्रतिक्रिया समय (औसत) 57.9s
#36	Claude Sonnet 5 medium	Anthropic	9.0	7.9	$0.550	2/3	17.3s
कुल टेस्ट 3 गलत टेस्ट 1 कुल लागत $0.550 प्रतिक्रिया समय (औसत) 17.3s
#50	Step 3.7 Flash low	Stepfun	8.2	7.7	$0.341	2/3	9.46s
कुल टेस्ट 3 गलत टेस्ट 1 कुल लागत $0.341 प्रतिक्रिया समय (औसत) 9.46s
#57	Mercury 2 medium	Inception	8.2	7.5	$0.058	2/3	2.04s
कुल टेस्ट 3 गलत टेस्ट 1 कुल लागत $0.058 प्रतिक्रिया समय (औसत) 2.04s
#79	Kimi K2.7 Code medium	Moonshot AI	7.6	7.0	$0.581	2/3	146.7s
कुल टेस्ट 3 गलत टेस्ट 1 कुल लागत $0.581 प्रतिक्रिया समय (औसत) 146.7s
#80	Gemini 3.5 Flash none	Google	8.8	7.0	$1.079	2/3	34.7s
कुल टेस्ट 3 गलत टेस्ट 1 कुल लागत $1.079 प्रतिक्रिया समय (औसत) 34.7s
#89	Qwen3.6 35B A3B medium	Qwen	7.7	6.7	$0.146	2/3	50.5s
कुल टेस्ट 3 गलत टेस्ट 1 कुल लागत $0.146 प्रतिक्रिया समय (औसत) 50.5s
#95	Qwen3.6 27B medium	Qwen	7.7	6.6	$0.336	2/3	143.0s
कुल टेस्ट 3 गलत टेस्ट 1 कुल लागत $0.336 प्रतिक्रिया समय (औसत) 143.0s

कोडिंग रैंकिंग

मॉडल फ़िल्टर करें

कोडिंग स्कोर के अनुसार शीर्ष मॉडल

कोडिंग स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत) के अनुसार शीर्ष मॉडल