निर्देश पालन मॉडल रैंकिंग

देखें कि निर्देश पालन में कौन से AI मॉडल सबसे अच्छा प्रदर्शन करते हैं, कौन से भरोसेमंद बने रहते हैं और सबसे बड़े अंतर कहाँ दिखाई देते हैं। क्रमबद्ध करें: प्रतिक्रिया समय (औसत) ↓.

दिखाए गए मॉडल

औसत निर्देश पालन स्कोर

8.6

सर्वश्रेष्ठ मॉडल

Kimi K2.5 10.0

विफलता के कारण

विफलता कारण गलत उत्तर के साथ61 विफलता कारण निर्देशों का पालन नहीं किया के साथ19 विफलता कारण अतिरिक्त फॉर्मेटिंग के साथ3 विफलता कारण कोई उत्तर नहीं के साथ2 विफलता कारण API त्रुटि के साथ1 विफलता कारण समय समाप्त के साथ1

216/216

रैंक	मॉडल	कंपनी	निर्देश पालन स्कोर	स्कोर	कुल लागत	सही परीक्षण	प्रतिक्रिया समय (औसत)
#67	Claude Sonnet 4.6 none	Anthropic	6.5	7.3	$0.661	1/2	1.96s
कुल टेस्ट 2 गलत टेस्ट 1 कुल लागत $0.661 प्रतिक्रिया समय (औसत) 1.96s
#158	Qwen3.6 27B none	Qwen	6.2	5.5	$0.087	1/2	1.92s
कुल टेस्ट 2 गलत टेस्ट 1 कुल लागत $0.087 प्रतिक्रिया समय (औसत) 1.92s
#68	Gemini 3.1 Flash Lite Preview medium	Google	10.0	7.3	$0.115	2/2	1.91s
कुल टेस्ट 2 गलत टेस्ट 0 कुल लागत $0.115 प्रतिक्रिया समय (औसत) 1.91s
#57	GPT-5.4 Nano medium	OpenAI	9.8	7.5	$0.138	2/2	1.88s
कुल टेस्ट 2 गलत टेस्ट 0 कुल लागत $0.138 प्रतिक्रिया समय (औसत) 1.88s
#31	Gemini 3.5 Flash-Lite high	Google	8.5	8.1	$0.584	1/2	1.87s
कुल टेस्ट 2 गलत टेस्ट 1 कुल लागत $0.584 प्रतिक्रिया समय (औसत) 1.87s
#14	Gemini 3.5 Flash low	Google	9.9	8.9	$0.433	2/2	1.86s
कुल टेस्ट 2 गलत टेस्ट 0 कुल लागत $0.433 प्रतिक्रिया समय (औसत) 1.86s
#167	Qwen3.6 35B A3B none	Qwen	6.2	5.3	$0.061	1/2	1.86s
कुल टेस्ट 2 गलत टेस्ट 1 कुल लागत $0.061 प्रतिक्रिया समय (औसत) 1.86s
#33	Step 3.7 Flash medium	Stepfun	9.8	8.0	$0.515	2/2	1.83s
कुल टेस्ट 2 गलत टेस्ट 0 कुल लागत $0.515 प्रतिक्रिया समय (औसत) 1.83s
#129	Inkling low	Thinkingmachines	9.8	6.1	$0.187	2/2	1.81s
कुल टेस्ट 2 गलत टेस्ट 0 कुल लागत $0.187 प्रतिक्रिया समय (औसत) 1.81s
#107	MiMo-V2.5 medium	Xiaomi	9.9	6.5	$0.082	2/2	1.80s
कुल टेस्ट 2 गलत टेस्ट 0 कुल लागत $0.082 प्रतिक्रिया समय (औसत) 1.80s
#48	GPT-5.6 Luna high	OpenAI	9.9	7.7	$1.017	2/2	1.79s
कुल टेस्ट 2 गलत टेस्ट 0 कुल लागत $1.017 प्रतिक्रिया समय (औसत) 1.79s
#188	KAT-Coder-Air V2.5 none	Kwaipilot	9.9	4.8	$0.067	2/2	1.75s
कुल टेस्ट 2 गलत टेस्ट 0 कुल लागत $0.067 प्रतिक्रिया समय (औसत) 1.75s
#170	Inkling none	Thinkingmachines	6.3	5.2	$0.147	1/2	1.72s
कुल टेस्ट 2 गलत टेस्ट 1 कुल लागत $0.147 प्रतिक्रिया समय (औसत) 1.72s
#204	Laguna Xs.2 medium	Poolside	10.0	4.1	$0.015	2/2	1.68s
कुल टेस्ट 2 गलत टेस्ट 0 कुल लागत $0.015 प्रतिक्रिया समय (औसत) 1.68s
#113	Qwen3.5 Plus 2026-02-15 none	Qwen	10.0	6.4	$0.073	2/2	1.67s
कुल टेस्ट 2 गलत टेस्ट 0 कुल लागत $0.073 प्रतिक्रिया समय (औसत) 1.67s

←

1 9 10 11 15

→

निर्देश पालन रैंकिंग

मॉडल फ़िल्टर करें

निर्देश पालन स्कोर के अनुसार शीर्ष मॉडल

निर्देश पालन स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत) के अनुसार शीर्ष मॉडल