ترتيب إخفاقات لم يتبع التعليمات

اكتشف أي نماذج الذكاء الاصطناعي تواجه لم يتبع التعليمات أكثر من غيرها، حتى ترى مخاطر الاعتمادية قبل الاختيار.

النماذج المعروضة

إجمالي الإخفاقات

245

النموذج الأكثر تأثرًا

الفئات

ضمن الفئة حل الألغاز90 ضمن الفئة الذكاء العام78 ضمن الفئة حيل مضادة للذكاء الاصطناعي33 ضمن الفئة اتباع التعليمات18 ضمن الفئة البرمجة16 ضمن الفئة استدعاء الأدوات8 ضمن الفئة خاص بالمجال1 ضمن الفئة مجمّع1

140/140

الترتيب	النموذج	الشركة	عدد لم يتبع التعليمات	النتيجة	إجمالي التكلفة	اختبارات صحيحة	زمن الاستجابة (المتوسط)
#123	Inkling low	Thinkingmachines	2	6.1	$0.187	10/22	5.15s
إجمالي الاختبارات 22 الاختبارات الخاطئة 12 إجمالي التكلفة $0.187 زمن الاستجابة (المتوسط) 5.15s
#126	Qwen3.5 Plus 2026-04-20 none	Qwen	2	6.1	$0.122	8/22	13.6s
إجمالي الاختبارات 22 الاختبارات الخاطئة 14 إجمالي التكلفة $0.122 زمن الاستجابة (المتوسط) 13.6s
#127	Qwen3.5-35B-A3B none	Qwen	2	6.1	$0.106	7/22	12.7s
إجمالي الاختبارات 22 الاختبارات الخاطئة 15 إجمالي التكلفة $0.106 زمن الاستجابة (المتوسط) 12.7s
#128	GPT-5 Nano medium	OpenAI	2	6.1	$0.114	9/22	54.9s
إجمالي الاختبارات 22 الاختبارات الخاطئة 13 إجمالي التكلفة $0.114 زمن الاستجابة (المتوسط) 54.9s
#134	Mimo V2 Omni medium	Xiaomi	2	5.9	$0.683	10/21	41.2s
إجمالي الاختبارات 21 الاختبارات الخاطئة 11 إجمالي التكلفة $0.683 زمن الاستجابة (المتوسط) 41.2s
#142	Qwen3.5-122B-A10B none	Qwen	2	5.7	$0.247	6/22	12.9s
إجمالي الاختبارات 22 الاختبارات الخاطئة 16 إجمالي التكلفة $0.247 زمن الاستجابة (المتوسط) 12.9s
#145	GLM 5V Turbo none	Z.ai	2	5.6	$0.052	8/21	2.99s
إجمالي الاختبارات 21 الاختبارات الخاطئة 13 إجمالي التكلفة $0.052 زمن الاستجابة (المتوسط) 2.99s
#146	Owl Alpha medium	Openrouter	2	5.6	$0.000	8/21	11.9s
إجمالي الاختبارات 21 الاختبارات الخاطئة 13 إجمالي التكلفة $0.000 زمن الاستجابة (المتوسط) 11.9s
#147	Mimo V2 PRO none	Xiaomi	2	5.6	$0.045	7/21	2.27s
إجمالي الاختبارات 21 الاختبارات الخاطئة 14 إجمالي التكلفة $0.045 زمن الاستجابة (المتوسط) 2.27s
#152	Qwen3.6 27B none	Qwen	2	5.5	$0.087	7/22	10.7s
إجمالي الاختبارات 22 الاختبارات الخاطئة 15 إجمالي التكلفة $0.087 زمن الاستجابة (المتوسط) 10.7s
#156	Gemma 4 26B A4B none	Google	2	5.5	$0.015	8/22	7.64s
إجمالي الاختبارات 22 الاختبارات الخاطئة 14 إجمالي التكلفة $0.015 زمن الاستجابة (المتوسط) 7.64s
#158	KAT-Coder-Air V2.5 low	Kwaipilot	2	5.4	$0.041	7/22	10.1s
إجمالي الاختبارات 22 الاختبارات الخاطئة 15 إجمالي التكلفة $0.041 زمن الاستجابة (المتوسط) 10.1s
#161	Qwen3.6 35B A3B none	Qwen	2	5.3	$0.061	4/22	5.52s
إجمالي الاختبارات 22 الاختبارات الخاطئة 18 إجمالي التكلفة $0.061 زمن الاستجابة (المتوسط) 5.52s
#162	Ling-2.6-1T none	Inclusionai	2	5.3	$0.016	4/22	8.58s
إجمالي الاختبارات 22 الاختبارات الخاطئة 18 إجمالي التكلفة $0.016 زمن الاستجابة (المتوسط) 8.58s
#167	Mistral Small 4 medium	Mistral	2	5.1	$0.096	5/22	10.8s
إجمالي الاختبارات 22 الاختبارات الخاطئة 17 إجمالي التكلفة $0.096 زمن الاستجابة (المتوسط) 10.8s

إخفاقات لم يتبع التعليمات

تصفية النماذج

أفضل النماذج حسب عدد لم يتبع التعليمات

عدد لم يتبع التعليمات مقابل النتيجة

أفضل النماذج حسب زمن الاستجابة (المتوسط)