निर्देशों का पालन नहीं किया विफलता रैंकिंग

देखें कि किन AI मॉडलों में निर्देशों का पालन नहीं किया सबसे अधिक होता है, ताकि आप चुनने से पहले भरोसेमंदी के जोखिम समझ सकें। क्रमबद्ध करें: सही परीक्षण ↓.

दिखाए गए मॉडल

कुल विफलताएँ

246

सबसे अधिक प्रभावित मॉडल

Gemini 3.5 Flash 1

श्रेणियाँ

पहेली समाधान श्रेणी में90 Samanya Buddhimatta श्रेणी में78 एंटी-एआई ट्रिक्स श्रेणी में33 निर्देश पालन श्रेणी में19 कोडिंग श्रेणी में16 टूल कॉलिंग श्रेणी में8 डोमेन-विशिष्ट श्रेणी में1 संयुक्त श्रेणी में1

141/141

रैंक	मॉडल	कंपनी	निर्देशों का पालन नहीं किया संख्या	स्कोर	कुल लागत	सही परीक्षण	प्रतिक्रिया समय (औसत)
#142	GPT-5.4 Mini none	OpenAI	3	5.9	$0.095	6/22	1.53s
कुल टेस्ट 22 गलत टेस्ट 16 कुल लागत $0.095 प्रतिक्रिया समय (औसत) 1.53s
#148	Qwen3.5-122B-A10B none	Qwen	2	5.7	$0.247	6/22	12.9s
कुल टेस्ट 22 गलत टेस्ट 16 कुल लागत $0.247 प्रतिक्रिया समय (औसत) 12.9s
#160	MiMo-V2.5-Pro none	Xiaomi	4	5.5	$0.068	6/22	4.12s
कुल टेस्ट 22 गलत टेस्ट 16 कुल लागत $0.068 प्रतिक्रिया समय (औसत) 4.12s
#170	Inkling none	Thinkingmachines	1	5.2	$0.147	6/22	3.50s
कुल टेस्ट 22 गलत टेस्ट 16 कुल लागत $0.147 प्रतिक्रिया समय (औसत) 3.50s
#179	DeepSeek V3.2 none	DeepSeek	1	5.0	$0.054	6/22	18.3s
कुल टेस्ट 22 गलत टेस्ट 16 कुल लागत $0.054 प्रतिक्रिया समय (औसत) 18.3s
#182	GLM 4.7 Flash none	Z.ai	1	4.9	$0.016	6/22	9.15s
कुल टेस्ट 22 गलत टेस्ट 16 कुल लागत $0.016 प्रतिक्रिया समय (औसत) 9.15s
#184	Ling-2.6-flash none	Inclusionai	2	4.9	$0.002	6/22	10.7s
कुल टेस्ट 22 गलत टेस्ट 16 कुल लागत $0.002 प्रतिक्रिया समय (औसत) 10.7s
#211	Laguna Xs.2 none	Poolside	1	3.8	$0.004	5/19	806ms
कुल टेस्ट 19 गलत टेस्ट 14 कुल लागत $0.004 प्रतिक्रिया समय (औसत) 806ms
#199	Elephant Alpha none	Openrouter	3	4.3	$0.000	5/21	1.22s
कुल टेस्ट 21 गलत टेस्ट 16 कुल लागत $0.000 प्रतिक्रिया समय (औसत) 1.22s
#156	DeepSeek V4 Flash none	DeepSeek	1	5.6	$0.042	5/22	36.8s
कुल टेस्ट 22 गलत टेस्ट 17 कुल लागत $0.042 प्रतिक्रिया समय (औसत) 36.8s
#166	Laguna XS 2.1 none	Poolside	1	5.3	$0.008	5/22	1.55s
कुल टेस्ट 22 गलत टेस्ट 17 कुल लागत $0.008 प्रतिक्रिया समय (औसत) 1.55s
#171	Mistral Small 4 none	Mistral	1	5.1	$0.022	5/22	1.20s
कुल टेस्ट 22 गलत टेस्ट 17 कुल लागत $0.022 प्रतिक्रिया समय (औसत) 1.20s
#172	Qwen3 Coder Next none	Qwen	1	5.1	$0.025	5/22	9.12s
कुल टेस्ट 22 गलत टेस्ट 17 कुल लागत $0.025 प्रतिक्रिया समय (औसत) 9.12s
#173	Mistral Small 4 medium	Mistral	2	5.1	$0.096	5/22	10.8s
कुल टेस्ट 22 गलत टेस्ट 17 कुल लागत $0.096 प्रतिक्रिया समय (औसत) 10.8s
#174	MiMo-V2.5 none	Xiaomi	1	5.1	$0.025	5/22	4.62s
कुल टेस्ट 22 गलत टेस्ट 17 कुल लागत $0.025 प्रतिक्रिया समय (औसत) 4.62s

निर्देशों का पालन नहीं किया विफलताएँ

मॉडल फ़िल्टर करें

निर्देशों का पालन नहीं किया संख्या के अनुसार शीर्ष मॉडल

निर्देशों का पालन नहीं किया संख्या बनाम स्कोर

प्रतिक्रिया समय (औसत) के अनुसार शीर्ष मॉडल