ترتيب إخفاقات إجابة خاطئة

اكتشف أي نماذج الذكاء الاصطناعي تواجه إجابة خاطئة أكثر من غيرها، حتى ترى مخاطر الاعتمادية قبل الاختيار.

النماذج المعروضة

إجمالي الإخفاقات

1558

النموذج الأكثر تأثرًا

الفئات

ضمن الفئة خاص بالمجال412 ضمن الفئة حيل مضادة للذكاء الاصطناعي293 ضمن الفئة البرمجة252 ضمن الفئة حل الألغاز201 ضمن الفئة معلومات عامة168 ضمن الفئة مجمّع68 ضمن الفئة اتباع التعليمات61 ضمن الفئة الذكاء العام59 ضمن الفئة تحليل البيانات واستخراجها41 ضمن الفئة استدعاء الأدوات3

209/209

الترتيب	النموذج	الشركة	عدد إجابة خاطئة	النتيجة	إجمالي التكلفة	اختبارات صحيحة	زمن الاستجابة (المتوسط)
#136	GPT-5.4 Mini none	OpenAI	13	5.9	$0.095	6/22	1.53s
إجمالي الاختبارات 22 الاختبارات الخاطئة 16 إجمالي التكلفة $0.095 زمن الاستجابة (المتوسط) 1.53s
#142	Qwen3.5-122B-A10B none	Qwen	13	5.7	$0.247	6/22	12.9s
إجمالي الاختبارات 22 الاختبارات الخاطئة 16 إجمالي التكلفة $0.247 زمن الاستجابة (المتوسط) 12.9s
#151	GLM 5.1 none	Z.ai	13	5.5	$0.164	7/22	6.70s
إجمالي الاختبارات 22 الاختبارات الخاطئة 15 إجمالي التكلفة $0.164 زمن الاستجابة (المتوسط) 6.70s
#161	Qwen3.6 35B A3B none	Qwen	13	5.3	$0.061	4/22	5.52s
إجمالي الاختبارات 22 الاختبارات الخاطئة 18 إجمالي التكلفة $0.061 زمن الاستجابة (المتوسط) 5.52s
#164	Inkling none	Thinkingmachines	13	5.2	$0.147	6/22	3.50s
إجمالي الاختبارات 22 الاختبارات الخاطئة 16 إجمالي التكلفة $0.147 زمن الاستجابة (المتوسط) 3.50s
#170	GLM 5 Turbo none	Z.ai	13	5.1	$0.047	6/21	2.82s
إجمالي الاختبارات 21 الاختبارات الخاطئة 15 إجمالي التكلفة $0.047 زمن الاستجابة (المتوسط) 2.82s
#176	GLM 4.7 Flash none	Z.ai	13	4.9	$0.016	6/22	9.15s
إجمالي الاختبارات 22 الاختبارات الخاطئة 16 إجمالي التكلفة $0.016 زمن الاستجابة (المتوسط) 9.15s
#182	KAT-Coder-Air V2.5 none	Kwaipilot	13	4.8	$0.067	5/22	12.2s
إجمالي الاختبارات 22 الاختبارات الخاطئة 17 إجمالي التكلفة $0.067 زمن الاستجابة (المتوسط) 12.2s
#187	Qwen3 Coder Next medium	Qwen	13	4.7	$0.032	4/22	9.61s
إجمالي الاختبارات 22 الاختبارات الخاطئة 18 إجمالي التكلفة $0.032 زمن الاستجابة (المتوسط) 9.61s
#200	MiMo-V2-Flash none	Xiaomi	13	4.0	$0.025	4/21	2.76s
إجمالي الاختبارات 21 الاختبارات الخاطئة 17 إجمالي التكلفة $0.025 زمن الاستجابة (المتوسط) 2.76s
#201	Granite 4.1 8B none	IBM Granite	13	4.0	$0.007	2/22	1.45s
إجمالي الاختبارات 22 الاختبارات الخاطئة 20 إجمالي التكلفة $0.007 زمن الاستجابة (المتوسط) 1.45s
#203	Grok 4.1 Fast none	X AI	13	3.8	$0.008	3/19	1.62s
إجمالي الاختبارات 19 الاختبارات الخاطئة 16 إجمالي التكلفة $0.008 زمن الاستجابة (المتوسط) 1.62s
#103	Qwen3.5-27B none	Qwen	12	6.5	$0.090	8/22	4.76s
إجمالي الاختبارات 22 الاختبارات الخاطئة 14 إجمالي التكلفة $0.090 زمن الاستجابة (المتوسط) 4.76s
#107	Qwen3.5 Plus 2026-02-15 none	Qwen	12	6.4	$0.073	10/22	9.85s
إجمالي الاختبارات 22 الاختبارات الخاطئة 12 إجمالي التكلفة $0.073 زمن الاستجابة (المتوسط) 9.85s
#118	Gemini 2.5 Flash none	Google	12	6.2	$0.017	9/22	6.20s
إجمالي الاختبارات 22 الاختبارات الخاطئة 13 إجمالي التكلفة $0.017 زمن الاستجابة (المتوسط) 6.20s

إخفاقات إجابة خاطئة

تصفية النماذج

أفضل النماذج حسب عدد إجابة خاطئة

عدد إجابة خاطئة مقابل النتيجة

أفضل النماذج حسب زمن الاستجابة (المتوسط)