ترتيب إخفاقات لم يتبع التعليمات

اكتشف أي نماذج الذكاء الاصطناعي تواجه لم يتبع التعليمات أكثر من غيرها، حتى ترى مخاطر الاعتمادية قبل الاختيار. الترتيب حسب: عدد الإخفاقات ↑.

النماذج المعروضة

إجمالي الإخفاقات

245

النموذج الأكثر تأثرًا

Gemini 3.5 Flash 1

الفئات

ضمن الفئة حل الألغاز90 ضمن الفئة الذكاء العام78 ضمن الفئة حيل مضادة للذكاء الاصطناعي33 ضمن الفئة اتباع التعليمات18 ضمن الفئة البرمجة16 ضمن الفئة استدعاء الأدوات8 ضمن الفئة خاص بالمجال1 ضمن الفئة مجمّع1

140/140

الترتيب	النموذج	الشركة	عدد لم يتبع التعليمات	النتيجة	إجمالي التكلفة	اختبارات صحيحة	زمن الاستجابة (المتوسط)
#101	MiMo-V2.5 medium	Xiaomi	1	6.5	$0.082	12/22	32.2s
إجمالي الاختبارات 22 الاختبارات الخاطئة 10 إجمالي التكلفة $0.082 زمن الاستجابة (المتوسط) 32.2s
#104	Gemini 3.1 Flash Lite Preview low	Google	1	6.5	$0.646	13/22	16.7s
إجمالي الاختبارات 22 الاختبارات الخاطئة 9 إجمالي التكلفة $0.646 زمن الاستجابة (المتوسط) 16.7s
#109	Mimo V2 PRO medium	Xiaomi	1	6.3	$0.333	12/21	22.2s
إجمالي الاختبارات 21 الاختبارات الخاطئة 9 إجمالي التكلفة $0.333 زمن الاستجابة (المتوسط) 22.2s
#112	Claude Sonnet 5 none	Anthropic	1	6.3	$0.548	8/22	6.04s
إجمالي الاختبارات 22 الاختبارات الخاطئة 14 إجمالي التكلفة $0.548 زمن الاستجابة (المتوسط) 6.04s
#113	MiMo-V2-Flash medium	Xiaomi	1	6.3	$0.043	12/21	20.1s
إجمالي الاختبارات 21 الاختبارات الخاطئة 9 إجمالي التكلفة $0.043 زمن الاستجابة (المتوسط) 20.1s
#114	Qwen3.5-Flash medium	Qwen	1	6.2	$0.139	12/22	84.8s
إجمالي الاختبارات 22 الاختبارات الخاطئة 10 إجمالي التكلفة $0.139 زمن الاستجابة (المتوسط) 84.8s
#115	Gemma 4 31B none	Google	1	6.2	$0.035	10/22	5.34s
إجمالي الاختبارات 22 الاختبارات الخاطئة 12 إجمالي التكلفة $0.035 زمن الاستجابة (المتوسط) 5.34s
#117	GPT-5.6 Luna low	OpenAI	1	6.2	$0.249	10/22	5.04s
إجمالي الاختبارات 22 الاختبارات الخاطئة 12 إجمالي التكلفة $0.249 زمن الاستجابة (المتوسط) 5.04s
#122	Gemini 3.1 Flash Lite none	Google	1	6.1	$0.046	9/22	1.75s
إجمالي الاختبارات 22 الاختبارات الخاطئة 13 إجمالي التكلفة $0.046 زمن الاستجابة (المتوسط) 1.75s
#124	Qwen3.6 Flash none	Qwen	1	6.1	$0.062	7/22	3.74s
إجمالي الاختبارات 22 الاختبارات الخاطئة 15 إجمالي التكلفة $0.062 زمن الاستجابة (المتوسط) 3.74s
#129	Nemotron 3 Ultra none	NVIDIA	1	6.1	$0.095	8/22	3.87s
إجمالي الاختبارات 22 الاختبارات الخاطئة 14 إجمالي التكلفة $0.095 زمن الاستجابة (المتوسط) 3.87s
#131	Grok 4.20 Beta medium	X AI	1	6.0	$0.750	14/18	9.75s
إجمالي الاختبارات 18 الاختبارات الخاطئة 4 إجمالي التكلفة $0.750 زمن الاستجابة (المتوسط) 9.75s
#132	GPT-5.6 Terra none	OpenAI	1	6.0	$0.349	8/22	1.65s
إجمالي الاختبارات 22 الاختبارات الخاطئة 14 إجمالي التكلفة $0.349 زمن الاستجابة (المتوسط) 1.65s
#139	GPT-5.4 none	OpenAI	1	5.8	$0.397	7/22	2.07s
إجمالي الاختبارات 22 الاختبارات الخاطئة 15 إجمالي التكلفة $0.397 زمن الاستجابة (المتوسط) 2.07s
#149	KAT-Coder-Air V2.5 medium	Kwaipilot	1	5.6	$0.048	8/22	8.42s
إجمالي الاختبارات 22 الاختبارات الخاطئة 14 إجمالي التكلفة $0.048 زمن الاستجابة (المتوسط) 8.42s

إخفاقات لم يتبع التعليمات

تصفية النماذج

أفضل النماذج حسب عدد لم يتبع التعليمات

عدد لم يتبع التعليمات مقابل النتيجة

أفضل النماذج حسب زمن الاستجابة (المتوسط)