निर्देशों का पालन नहीं किया विफलता रैंकिंग

देखें कि किन AI मॉडलों में निर्देशों का पालन नहीं किया सबसे अधिक होता है, ताकि आप चुनने से पहले भरोसेमंदी के जोखिम समझ सकें। क्रमबद्ध करें: प्रतिक्रिया समय (औसत) ↓.

दिखाए गए मॉडल

कुल विफलताएँ

246

सबसे अधिक प्रभावित मॉडल

Step 3.5 Flash 3

श्रेणियाँ

पहेली समाधान श्रेणी में90 Samanya Buddhimatta श्रेणी में78 एंटी-एआई ट्रिक्स श्रेणी में33 निर्देश पालन श्रेणी में19 कोडिंग श्रेणी में16 टूल कॉलिंग श्रेणी में8 डोमेन-विशिष्ट श्रेणी में1 संयुक्त श्रेणी में1

141/141

रैंक	मॉडल	कंपनी	निर्देशों का पालन नहीं किया संख्या	स्कोर	कुल लागत	सही परीक्षण	प्रतिक्रिया समय (औसत)
#41	Qwen3.6 Plus medium	Qwen	1	7.8	$0.405	15/22	43.1s
कुल टेस्ट 22 गलत टेस्ट 7 कुल लागत $0.405 प्रतिक्रिया समय (औसत) 43.1s
#178	MiniMax M2.7 medium	Minimax	5	5.0	$0.163	5/22	41.3s
कुल टेस्ट 22 गलत टेस्ट 17 कुल लागत $0.163 प्रतिक्रिया समय (औसत) 41.3s
#140	Mimo V2 Omni medium	Xiaomi	2	5.9	$0.683	10/21	41.2s
कुल टेस्ट 21 गलत टेस्ट 11 कुल लागत $0.683 प्रतिक्रिया समय (औसत) 41.2s
#194	Cobuddy medium	Baidu	3	4.7	$0.000	7/21	39.9s
कुल टेस्ट 21 गलत टेस्ट 14 कुल लागत $0.000 प्रतिक्रिया समय (औसत) 39.9s
#215	Step 3.5 Flash none	Stepfun	1	2.3	$0.020	6/12	39.0s
कुल टेस्ट 12 गलत टेस्ट 6 कुल लागत $0.020 प्रतिक्रिया समय (औसत) 39.0s
#156	DeepSeek V4 Flash none	DeepSeek	1	5.6	$0.042	5/22	36.8s
कुल टेस्ट 22 गलत टेस्ट 17 कुल लागत $0.042 प्रतिक्रिया समय (औसत) 36.8s
#47	Claude Opus 4.6 medium	Anthropic	1	7.7	$3.059	13/22	34.3s
कुल टेस्ट 22 गलत टेस्ट 9 कुल लागत $3.059 प्रतिक्रिया समय (औसत) 34.3s
#88	MiMo-V2.5-Pro medium	Xiaomi	2	6.9	$0.187	12/22	33.9s
कुल टेस्ट 22 गलत टेस्ट 10 कुल लागत $0.187 प्रतिक्रिया समय (औसत) 33.9s
#46	GLM 5 medium	Z.ai	1	7.7	$0.307	15/21	33.5s
कुल टेस्ट 21 गलत टेस्ट 6 कुल लागत $0.307 प्रतिक्रिया समय (औसत) 33.5s
#107	MiMo-V2.5 medium	Xiaomi	1	6.5	$0.082	12/22	32.2s
कुल टेस्ट 22 गलत टेस्ट 10 कुल लागत $0.082 प्रतिक्रिया समय (औसत) 32.2s
#30	Muse Spark 1.1 high	Meta	2	8.1	$1.694	12/22	31.5s
कुल टेस्ट 22 गलत टेस्ट 10 कुल लागत $1.694 प्रतिक्रिया समय (औसत) 31.5s
#177	North Mini Code none	Cohere	2	5.1	$0.000	4/22	29.9s
कुल टेस्ट 22 गलत टेस्ट 18 कुल लागत $0.000 प्रतिक्रिया समय (औसत) 29.9s
#79	Grok 4.20 medium	X AI	2	7.1	$0.777	12/22	29.5s
कुल टेस्ट 22 गलत टेस्ट 10 कुल लागत $0.777 प्रतिक्रिया समय (औसत) 29.5s
#208	Grok Build 0.1 none	X AI	2	4.0	$0.547	7/19	28.7s
कुल टेस्ट 19 गलत टेस्ट 12 कुल लागत $0.547 प्रतिक्रिया समय (औसत) 28.7s
#29	GPT-5 Mini medium	OpenAI	3	8.1	$0.237	12/22	27.6s
कुल टेस्ट 22 गलत टेस्ट 10 कुल लागत $0.237 प्रतिक्रिया समय (औसत) 27.6s

निर्देशों का पालन नहीं किया विफलताएँ

मॉडल फ़िल्टर करें

निर्देशों का पालन नहीं किया संख्या के अनुसार शीर्ष मॉडल

निर्देशों का पालन नहीं किया संख्या बनाम स्कोर

प्रतिक्रिया समय (औसत) के अनुसार शीर्ष मॉडल