निर्देशों का पालन नहीं किया विफलता रैंकिंग

देखें कि किन AI मॉडलों में निर्देशों का पालन नहीं किया सबसे अधिक होता है, ताकि आप चुनने से पहले भरोसेमंदी के जोखिम समझ सकें। क्रमबद्ध करें: प्रतिक्रिया समय (औसत) ↑.

दिखाए गए मॉडल

कुल विफलताएँ

245

सबसे अधिक प्रभावित मॉडल

Nemotron 3 Nano Omni 30b A3b Reasoning 2

श्रेणियाँ

पहेली समाधान श्रेणी में90 Samanya Buddhimatta श्रेणी में78 एंटी-एआई ट्रिक्स श्रेणी में33 निर्देश पालन श्रेणी में18 कोडिंग श्रेणी में16 टूल कॉलिंग श्रेणी में8 डोमेन-विशिष्ट श्रेणी में1 संयुक्त श्रेणी में1

140/140

रैंक	मॉडल	कंपनी	निर्देशों का पालन नहीं किया संख्या	स्कोर	कुल लागत	सही परीक्षण	प्रतिक्रिया समय (औसत)
#208	Nemotron 3 Nano Omni 30b A3b Reasoning none	NVIDIA	2	3.2	$0.000	2/19	728ms
कुल टेस्ट 19 गलत टेस्ट 17 कुल लागत $0.000 प्रतिक्रिया समय (औसत) 728ms
#210	LFM2-24B-A2B none	Liquid	1	2.2	$0.001	2/16	782ms
कुल टेस्ट 16 गलत टेस्ट 14 कुल लागत $0.001 प्रतिक्रिया समय (औसत) 782ms
#205	Laguna Xs.2 none	Poolside	1	3.8	$0.004	5/19	806ms
कुल टेस्ट 19 गलत टेस्ट 14 कुल लागत $0.004 प्रतिक्रिया समय (औसत) 806ms
#189	Mercury 2 none	Inception	1	4.6	$0.030	4/22	829ms
कुल टेस्ट 22 गलत टेस्ट 18 कुल लागत $0.030 प्रतिक्रिया समय (औसत) 829ms
#191	Grok 4.20 Beta none	X AI	1	4.4	$0.087	6/18	1.19s
कुल टेस्ट 18 गलत टेस्ट 12 कुल लागत $0.087 प्रतिक्रिया समय (औसत) 1.19s
#165	Mistral Small 4 none	Mistral	1	5.1	$0.022	5/22	1.20s
कुल टेस्ट 22 गलत टेस्ट 17 कुल लागत $0.022 प्रतिक्रिया समय (औसत) 1.20s
#193	Elephant Alpha none	Openrouter	3	4.3	$0.000	5/21	1.22s
कुल टेस्ट 21 गलत टेस्ट 16 कुल लागत $0.000 प्रतिक्रिया समय (औसत) 1.22s
#195	Elephant Alpha medium	Openrouter	2	4.3	$0.000	6/21	1.27s
कुल टेस्ट 21 गलत टेस्ट 15 कुल लागत $0.000 प्रतिक्रिया समय (औसत) 1.27s
#201	Granite 4.1 8B none	IBM Granite	4	4.0	$0.007	2/22	1.45s
कुल टेस्ट 22 गलत टेस्ट 20 कुल लागत $0.007 प्रतिक्रिया समय (औसत) 1.45s
#136	GPT-5.4 Mini none	OpenAI	3	5.9	$0.095	6/22	1.53s
कुल टेस्ट 22 गलत टेस्ट 16 कुल लागत $0.095 प्रतिक्रिया समय (औसत) 1.53s
#160	Laguna XS 2.1 none	Poolside	1	5.3	$0.008	5/22	1.55s
कुल टेस्ट 22 गलत टेस्ट 17 कुल लागत $0.008 प्रतिक्रिया समय (औसत) 1.55s
#106	Gemini 3.1 Flash Lite Preview none	Google	2	6.4	$0.052	12/22	1.58s
कुल टेस्ट 22 गलत टेस्ट 10 कुल लागत $0.052 प्रतिक्रिया समय (औसत) 1.58s
#203	Grok 4.1 Fast none	X AI	3	3.8	$0.008	3/19	1.62s
कुल टेस्ट 19 गलत टेस्ट 16 कुल लागत $0.008 प्रतिक्रिया समय (औसत) 1.62s
#132	GPT-5.6 Terra none	OpenAI	1	6.0	$0.349	8/22	1.65s
कुल टेस्ट 22 गलत टेस्ट 14 कुल लागत $0.349 प्रतिक्रिया समय (औसत) 1.65s
#122	Gemini 3.1 Flash Lite none	Google	1	6.1	$0.046	9/22	1.75s
कुल टेस्ट 22 गलत टेस्ट 13 कुल लागत $0.046 प्रतिक्रिया समय (औसत) 1.75s

1 2 10

→

निर्देशों का पालन नहीं किया विफलताएँ

मॉडल फ़िल्टर करें

निर्देशों का पालन नहीं किया संख्या के अनुसार शीर्ष मॉडल

निर्देशों का पालन नहीं किया संख्या बनाम स्कोर

प्रतिक्रिया समय (औसत) के अनुसार शीर्ष मॉडल