निर्देशों का पालन नहीं किया विफलता रैंकिंग

देखें कि किन AI मॉडलों में निर्देशों का पालन नहीं किया सबसे अधिक होता है, ताकि आप चुनने से पहले भरोसेमंदी के जोखिम समझ सकें।

दिखाए गए मॉडल

कुल विफलताएँ

245

सबसे अधिक प्रभावित मॉडल

MiniMax M2.7 5

श्रेणियाँ

पहेली समाधान श्रेणी में90 Samanya Buddhimatta श्रेणी में78 एंटी-एआई ट्रिक्स श्रेणी में33 निर्देश पालन श्रेणी में18 कोडिंग श्रेणी में16 टूल कॉलिंग श्रेणी में8 डोमेन-विशिष्ट श्रेणी में1 संयुक्त श्रेणी में1

140/140

रैंक	मॉडल	कंपनी	निर्देशों का पालन नहीं किया संख्या	स्कोर	कुल लागत	सही परीक्षण	प्रतिक्रिया समय (औसत)
#123	Inkling low	Thinkingmachines	2	6.1	$0.187	10/22	5.15s
कुल टेस्ट 22 गलत टेस्ट 12 कुल लागत $0.187 प्रतिक्रिया समय (औसत) 5.15s
#126	Qwen3.5 Plus 2026-04-20 none	Qwen	2	6.1	$0.122	8/22	13.6s
कुल टेस्ट 22 गलत टेस्ट 14 कुल लागत $0.122 प्रतिक्रिया समय (औसत) 13.6s
#127	Qwen3.5-35B-A3B none	Qwen	2	6.1	$0.106	7/22	12.7s
कुल टेस्ट 22 गलत टेस्ट 15 कुल लागत $0.106 प्रतिक्रिया समय (औसत) 12.7s
#128	GPT-5 Nano medium	OpenAI	2	6.1	$0.114	9/22	54.9s
कुल टेस्ट 22 गलत टेस्ट 13 कुल लागत $0.114 प्रतिक्रिया समय (औसत) 54.9s
#134	Mimo V2 Omni medium	Xiaomi	2	5.9	$0.683	10/21	41.2s
कुल टेस्ट 21 गलत टेस्ट 11 कुल लागत $0.683 प्रतिक्रिया समय (औसत) 41.2s
#142	Qwen3.5-122B-A10B none	Qwen	2	5.7	$0.247	6/22	12.9s
कुल टेस्ट 22 गलत टेस्ट 16 कुल लागत $0.247 प्रतिक्रिया समय (औसत) 12.9s
#145	GLM 5V Turbo none	Z.ai	2	5.6	$0.052	8/21	2.99s
कुल टेस्ट 21 गलत टेस्ट 13 कुल लागत $0.052 प्रतिक्रिया समय (औसत) 2.99s
#146	Owl Alpha medium	Openrouter	2	5.6	$0.000	8/21	11.9s
कुल टेस्ट 21 गलत टेस्ट 13 कुल लागत $0.000 प्रतिक्रिया समय (औसत) 11.9s
#147	Mimo V2 PRO none	Xiaomi	2	5.6	$0.045	7/21	2.27s
कुल टेस्ट 21 गलत टेस्ट 14 कुल लागत $0.045 प्रतिक्रिया समय (औसत) 2.27s
#152	Qwen3.6 27B none	Qwen	2	5.5	$0.087	7/22	10.7s
कुल टेस्ट 22 गलत टेस्ट 15 कुल लागत $0.087 प्रतिक्रिया समय (औसत) 10.7s
#156	Gemma 4 26B A4B none	Google	2	5.5	$0.015	8/22	7.64s
कुल टेस्ट 22 गलत टेस्ट 14 कुल लागत $0.015 प्रतिक्रिया समय (औसत) 7.64s
#158	KAT-Coder-Air V2.5 low	Kwaipilot	2	5.4	$0.041	7/22	10.1s
कुल टेस्ट 22 गलत टेस्ट 15 कुल लागत $0.041 प्रतिक्रिया समय (औसत) 10.1s
#161	Qwen3.6 35B A3B none	Qwen	2	5.3	$0.061	4/22	5.52s
कुल टेस्ट 22 गलत टेस्ट 18 कुल लागत $0.061 प्रतिक्रिया समय (औसत) 5.52s
#162	Ling-2.6-1T none	Inclusionai	2	5.3	$0.016	4/22	8.58s
कुल टेस्ट 22 गलत टेस्ट 18 कुल लागत $0.016 प्रतिक्रिया समय (औसत) 8.58s
#167	Mistral Small 4 medium	Mistral	2	5.1	$0.096	5/22	10.8s
कुल टेस्ट 22 गलत टेस्ट 17 कुल लागत $0.096 प्रतिक्रिया समय (औसत) 10.8s

निर्देशों का पालन नहीं किया विफलताएँ

मॉडल फ़िल्टर करें

निर्देशों का पालन नहीं किया संख्या के अनुसार शीर्ष मॉडल

निर्देशों का पालन नहीं किया संख्या बनाम स्कोर

प्रतिक्रिया समय (औसत) के अनुसार शीर्ष मॉडल