सूचनांचे पालन केले नाही अपयश क्रमवारी

कोणत्या AI मॉडेल्सना सूचनांचे पालन केले नाही सर्वाधिक वेळा येतो ते पाहा, म्हणजे निवडण्यापूर्वी विश्वासार्हतेचे धोके लक्षात येतील. क्रम लावा: प्रतिसाद वेळ (सरासरी) ↑.

दाखवलेली मॉडेल्स

एकूण अपयशे

245

सर्वाधिक प्रभावित मॉडेल

Nemotron 3 Nano Omni 30b A3b Reasoning 2

श्रेणी

कोडी सोडवणे श्रेणीत90 Samanya Buddhimatta श्रेणीत78 अँटी-एआय युक्त्या श्रेणीत33 सूचनांचे पालन श्रेणीत18 कोडिंग श्रेणीत16 टूल कॉलिंग श्रेणीत8 डोमेन-विशिष्ट श्रेणीत1 संयुक्त श्रेणीत1

140/140

क्रमांक	मॉडेल	कंपनी	सूचनांचे पालन केले नाही संख्या	स्कोअर	एकूण खर्च	बरोबर चाचण्या	प्रतिसाद वेळ (सरासरी)
#208	Nemotron 3 Nano Omni 30b A3b Reasoning none	NVIDIA	2	3.2	$0.000	2/19	728ms
एकूण चाचण्या 19 चुकीच्या चाचण्या 17 एकूण खर्च $0.000 प्रतिसाद वेळ (सरासरी) 728ms
#210	LFM2-24B-A2B none	Liquid	1	2.2	$0.001	2/16	782ms
एकूण चाचण्या 16 चुकीच्या चाचण्या 14 एकूण खर्च $0.001 प्रतिसाद वेळ (सरासरी) 782ms
#205	Laguna Xs.2 none	Poolside	1	3.8	$0.004	5/19	806ms
एकूण चाचण्या 19 चुकीच्या चाचण्या 14 एकूण खर्च $0.004 प्रतिसाद वेळ (सरासरी) 806ms
#189	Mercury 2 none	Inception	1	4.6	$0.030	4/22	829ms
एकूण चाचण्या 22 चुकीच्या चाचण्या 18 एकूण खर्च $0.030 प्रतिसाद वेळ (सरासरी) 829ms
#191	Grok 4.20 Beta none	X AI	1	4.4	$0.087	6/18	1.19s
एकूण चाचण्या 18 चुकीच्या चाचण्या 12 एकूण खर्च $0.087 प्रतिसाद वेळ (सरासरी) 1.19s
#165	Mistral Small 4 none	Mistral	1	5.1	$0.022	5/22	1.20s
एकूण चाचण्या 22 चुकीच्या चाचण्या 17 एकूण खर्च $0.022 प्रतिसाद वेळ (सरासरी) 1.20s
#193	Elephant Alpha none	Openrouter	3	4.3	$0.000	5/21	1.22s
एकूण चाचण्या 21 चुकीच्या चाचण्या 16 एकूण खर्च $0.000 प्रतिसाद वेळ (सरासरी) 1.22s
#195	Elephant Alpha medium	Openrouter	2	4.3	$0.000	6/21	1.27s
एकूण चाचण्या 21 चुकीच्या चाचण्या 15 एकूण खर्च $0.000 प्रतिसाद वेळ (सरासरी) 1.27s
#201	Granite 4.1 8B none	IBM Granite	4	4.0	$0.007	2/22	1.45s
एकूण चाचण्या 22 चुकीच्या चाचण्या 20 एकूण खर्च $0.007 प्रतिसाद वेळ (सरासरी) 1.45s
#136	GPT-5.4 Mini none	OpenAI	3	5.9	$0.095	6/22	1.53s
एकूण चाचण्या 22 चुकीच्या चाचण्या 16 एकूण खर्च $0.095 प्रतिसाद वेळ (सरासरी) 1.53s
#160	Laguna XS 2.1 none	Poolside	1	5.3	$0.008	5/22	1.55s
एकूण चाचण्या 22 चुकीच्या चाचण्या 17 एकूण खर्च $0.008 प्रतिसाद वेळ (सरासरी) 1.55s
#106	Gemini 3.1 Flash Lite Preview none	Google	2	6.4	$0.052	12/22	1.58s
एकूण चाचण्या 22 चुकीच्या चाचण्या 10 एकूण खर्च $0.052 प्रतिसाद वेळ (सरासरी) 1.58s
#203	Grok 4.1 Fast none	X AI	3	3.8	$0.008	3/19	1.62s
एकूण चाचण्या 19 चुकीच्या चाचण्या 16 एकूण खर्च $0.008 प्रतिसाद वेळ (सरासरी) 1.62s
#132	GPT-5.6 Terra none	OpenAI	1	6.0	$0.349	8/22	1.65s
एकूण चाचण्या 22 चुकीच्या चाचण्या 14 एकूण खर्च $0.349 प्रतिसाद वेळ (सरासरी) 1.65s
#122	Gemini 3.1 Flash Lite none	Google	1	6.1	$0.046	9/22	1.75s
एकूण चाचण्या 22 चुकीच्या चाचण्या 13 एकूण खर्च $0.046 प्रतिसाद वेळ (सरासरी) 1.75s

1 2 10

→

सूचनांचे पालन केले नाही अपयशे

मॉडेल फिल्टर करा

सूचनांचे पालन केले नाही संख्या नुसार शीर्ष मॉडेल्स

सूचनांचे पालन केले नाही संख्या वि स्कोअर

प्रतिसाद वेळ (सरासरी) नुसार शीर्ष मॉडेल्स