कोडिंग मॉडल रैंकिंग

AI BENCHY श्रेणी

देखें कि कोडिंग में कौन से AI मॉडल सबसे अच्छा प्रदर्शन करते हैं, कौन से भरोसेमंद बने रहते हैं और सबसे बड़े अंतर कहाँ दिखाई देते हैं। क्रमबद्ध करें: प्रतिक्रिया समय (औसत) ↓.

दिखाए गए मॉडल

औसत कोडिंग स्कोर

5.7

सर्वश्रेष्ठ मॉडल

North Mini Code 4.5

विफलता के कारण

विफलता कारण गलत उत्तर के साथ230 विफलता कारण API त्रुटि के साथ43 विफलता कारण समय समाप्त के साथ25 विफलता कारण कोई उत्तर नहीं के साथ18 विफलता कारण निर्देशों का पालन नहीं किया के साथ16 विफलता कारण अतिरिक्त फॉर्मेटिंग के साथ12

189/189

रैंक	मॉडल	कंपनी	कोडिंग स्कोर	स्कोर	कुल लागत	सही परीक्षण	प्रतिक्रिया समय (औसत)
#86	Ring-2.6-1T medium	Inclusionai	5.3	6.8	$0.033	1/3	59.6s
कुल टेस्ट 3 गलत टेस्ट 2 कुल लागत $0.033 प्रतिक्रिया समय (औसत) 59.6s
#84	Qwen3.5-Flash medium	Qwen	3.7	6.8	$0.080	0/3	58.9s
कुल टेस्ट 3 गलत टेस्ट 3 कुल लागत $0.080 प्रतिक्रिया समय (औसत) 58.9s
#33	GPT-5.4 Mini medium	OpenAI	8.4	8.0	$0.526	2/3	57.9s
कुल टेस्ट 3 गलत टेस्ट 1 कुल लागत $0.526 प्रतिक्रिया समय (औसत) 57.9s
#177	GLM 4.7 Flash medium	Z.ai	3.2	4.3	$0.054	0/3	55.3s
कुल टेस्ट 3 गलत टेस्ट 3 कुल लागत $0.054 प्रतिक्रिया समय (औसत) 55.3s
#27	DeepSeek V4 Flash high	DeepSeek	7.8	8.3	$0.027	2/3	50.6s
कुल टेस्ट 3 गलत टेस्ट 1 कुल लागत $0.027 प्रतिक्रिया समय (औसत) 50.6s
#89	Qwen3.6 35B A3B medium	Qwen	7.7	6.7	$0.146	2/3	50.5s
कुल टेस्ट 3 गलत टेस्ट 1 कुल लागत $0.146 प्रतिक्रिया समय (औसत) 50.5s
#24	GLM 5 Turbo medium	Z.ai	8.2	8.4	$0.323	2/3	45.9s
कुल टेस्ट 3 गलत टेस्ट 1 कुल लागत $0.323 प्रतिक्रिया समय (औसत) 45.9s
#20	GPT-5.4 medium	OpenAI	8.8	8.5	$1.210	2/3	44.4s
कुल टेस्ट 3 गलत टेस्ट 1 कुल लागत $1.210 प्रतिक्रिया समय (औसत) 44.4s
#60	Qwen3.6 Flash medium	Qwen	5.0	7.5	$0.288	0/3	42.9s
कुल टेस्ट 3 गलत टेस्ट 3 कुल लागत $0.288 प्रतिक्रिया समय (औसत) 42.9s
#93	GPT-5 Nano medium	OpenAI	7.0	6.7	$0.081	1/3	41.6s
कुल टेस्ट 3 गलत टेस्ट 2 कुल लागत $0.081 प्रतिक्रिया समय (औसत) 41.6s
#47	Grok 4.3 medium	X AI	5.9	7.7	$0.614	1/3	41.2s
कुल टेस्ट 3 गलत टेस्ट 2 कुल लागत $0.614 प्रतिक्रिया समय (औसत) 41.2s
#28	Gemini 2.5 Flash medium	Google	7.8	8.2	$0.379	2/3	41.0s
कुल टेस्ट 3 गलत टेस्ट 1 कुल लागत $0.379 प्रतिक्रिया समय (औसत) 41.0s
#17	GLM 5.2 medium	Z.ai	8.2	8.7	$0.179	2/3	41.0s
कुल टेस्ट 3 गलत टेस्ट 1 कुल लागत $0.179 प्रतिक्रिया समय (औसत) 41.0s
#10	Gemini 3.1 Pro Preview medium	Google	7.9	9.2	$1.054	2/3	40.2s
कुल टेस्ट 3 गलत टेस्ट 1 कुल लागत $1.054 प्रतिक्रिया समय (औसत) 40.2s
#153	Mistral Small 4 medium	Mistral	4.4	5.1	$0.068	0/3	40.0s
कुल टेस्ट 3 गलत टेस्ट 3 कुल लागत $0.068 प्रतिक्रिया समय (औसत) 40.0s

कोडिंग रैंकिंग

मॉडल फ़िल्टर करें

कोडिंग स्कोर के अनुसार शीर्ष मॉडल

कोडिंग स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत) के अनुसार शीर्ष मॉडल