निर्देशों का पालन नहीं किया विफलता रैंकिंग

देखें कि किन AI मॉडलों में निर्देशों का पालन नहीं किया सबसे अधिक होता है, ताकि आप चुनने से पहले भरोसेमंदी के जोखिम समझ सकें। क्रमबद्ध करें: सही परीक्षण ↑.

दिखाए गए मॉडल

कुल विफलताएँ

245

सबसे अधिक प्रभावित मॉडल

Granite 4.1 8B 4

श्रेणियाँ

पहेली समाधान श्रेणी में90 Samanya Buddhimatta श्रेणी में78 एंटी-एआई ट्रिक्स श्रेणी में33 निर्देश पालन श्रेणी में18 कोडिंग श्रेणी में16 टूल कॉलिंग श्रेणी में8 डोमेन-विशिष्ट श्रेणी में1 संयुक्त श्रेणी में1

140/140

रैंक	मॉडल	कंपनी	निर्देशों का पालन नहीं किया संख्या	स्कोर	कुल लागत	सही परीक्षण	प्रतिक्रिया समय (औसत)
#200	MiMo-V2-Flash none	Xiaomi	2	4.0	$0.025	4/21	2.76s
कुल टेस्ट 21 गलत टेस्ट 17 कुल लागत $0.025 प्रतिक्रिया समय (औसत) 2.76s
#207	Nemotron 3 Nano Omni 30b A3b Reasoning medium	NVIDIA	1	3.4	$0.000	4/19	17.1s
कुल टेस्ट 19 गलत टेस्ट 15 कुल लागत $0.000 प्रतिक्रिया समय (औसत) 17.1s
#150	DeepSeek V4 Flash none	DeepSeek	1	5.6	$0.044	5/22	36.8s
कुल टेस्ट 22 गलत टेस्ट 17 कुल लागत $0.044 प्रतिक्रिया समय (औसत) 36.8s
#160	Laguna XS 2.1 none	Poolside	1	5.3	$0.008	5/22	1.55s
कुल टेस्ट 22 गलत टेस्ट 17 कुल लागत $0.008 प्रतिक्रिया समय (औसत) 1.55s
#165	Mistral Small 4 none	Mistral	1	5.1	$0.022	5/22	1.20s
कुल टेस्ट 22 गलत टेस्ट 17 कुल लागत $0.022 प्रतिक्रिया समय (औसत) 1.20s
#166	Qwen3 Coder Next none	Qwen	1	5.1	$0.025	5/22	9.12s
कुल टेस्ट 22 गलत टेस्ट 17 कुल लागत $0.025 प्रतिक्रिया समय (औसत) 9.12s
#167	Mistral Small 4 medium	Mistral	2	5.1	$0.096	5/22	10.8s
कुल टेस्ट 22 गलत टेस्ट 17 कुल लागत $0.096 प्रतिक्रिया समय (औसत) 10.8s
#168	MiMo-V2.5 none	Xiaomi	1	5.1	$0.025	5/22	4.62s
कुल टेस्ट 22 गलत टेस्ट 17 कुल लागत $0.025 प्रतिक्रिया समय (औसत) 4.62s
#172	MiniMax M2.7 medium	Minimax	5	5.0	$0.163	5/22	41.3s
कुल टेस्ट 22 गलत टेस्ट 17 कुल लागत $0.163 प्रतिक्रिया समय (औसत) 41.3s
#174	GPT-4o-mini none	OpenAI	1	5.0	$0.010	5/22	1.99s
कुल टेस्ट 22 गलत टेस्ट 17 कुल लागत $0.010 प्रतिक्रिया समय (औसत) 1.99s
#177	Nemotron 3 Super none	NVIDIA	2	4.9	$0.008	5/22	5.97s
कुल टेस्ट 22 गलत टेस्ट 17 कुल लागत $0.008 प्रतिक्रिया समय (औसत) 5.97s
#190	MiniMax M2.5 medium	Minimax	3	4.6	$0.340	5/22	68.3s
कुल टेस्ट 22 गलत टेस्ट 17 कुल लागत $0.340 प्रतिक्रिया समय (औसत) 68.3s
#193	Elephant Alpha none	Openrouter	3	4.3	$0.000	5/21	1.22s
कुल टेस्ट 21 गलत टेस्ट 16 कुल लागत $0.000 प्रतिक्रिया समय (औसत) 1.22s
#205	Laguna Xs.2 none	Poolside	1	3.8	$0.004	5/19	806ms
कुल टेस्ट 19 गलत टेस्ट 14 कुल लागत $0.004 प्रतिक्रिया समय (औसत) 806ms
#136	GPT-5.4 Mini none	OpenAI	3	5.9	$0.095	6/22	1.53s
कुल टेस्ट 22 गलत टेस्ट 16 कुल लागत $0.095 प्रतिक्रिया समय (औसत) 1.53s

निर्देशों का पालन नहीं किया विफलताएँ

मॉडल फ़िल्टर करें

निर्देशों का पालन नहीं किया संख्या के अनुसार शीर्ष मॉडल

निर्देशों का पालन नहीं किया संख्या बनाम स्कोर

प्रतिक्रिया समय (औसत) के अनुसार शीर्ष मॉडल