ترتيب إخفاقات إجابة خاطئة

اكتشف أي نماذج الذكاء الاصطناعي تواجه إجابة خاطئة أكثر من غيرها، حتى ترى مخاطر الاعتمادية قبل الاختيار. الترتيب حسب: زمن الاستجابة (المتوسط) ↓.

النماذج المعروضة

إجمالي الإخفاقات

1585

النموذج الأكثر تأثرًا

Step 3.5 Flash 4

الفئات

ضمن الفئة خاص بالمجال421 ضمن الفئة حيل مضادة للذكاء الاصطناعي293 ضمن الفئة البرمجة259 ضمن الفئة حل الألغاز204 ضمن الفئة معلومات عامة172 ضمن الفئة مجمّع69 ضمن الفئة الذكاء العام62 ضمن الفئة اتباع التعليمات61 ضمن الفئة تحليل البيانات واستخراجها41 ضمن الفئة استدعاء الأدوات3

215/215

الترتيب	النموذج	الشركة	عدد إجابة خاطئة	النتيجة	إجمالي التكلفة	اختبارات صحيحة	زمن الاستجابة (المتوسط)
#177	North Mini Code none	Cohere	12	5.1	$0.000	4/22	29.9s
إجمالي الاختبارات 22 الاختبارات الخاطئة 18 إجمالي التكلفة $0.000 زمن الاستجابة (المتوسط) 29.9s
#79	Grok 4.20 medium	X AI	6	7.1	$0.777	12/22	29.5s
إجمالي الاختبارات 22 الاختبارات الخاطئة 10 إجمالي التكلفة $0.777 زمن الاستجابة (المتوسط) 29.5s
#208	Grok Build 0.1 none	X AI	7	4.0	$0.547	7/19	28.7s
إجمالي الاختبارات 19 الاختبارات الخاطئة 12 إجمالي التكلفة $0.547 زمن الاستجابة (المتوسط) 28.7s
#29	GPT-5 Mini medium	OpenAI	5	8.1	$0.237	12/22	27.6s
إجمالي الاختبارات 22 الاختبارات الخاطئة 10 إجمالي التكلفة $0.237 زمن الاستجابة (المتوسط) 27.6s
#33	Step 3.7 Flash medium	Stepfun	5	8.0	$0.515	14/22	26.4s
إجمالي الاختبارات 22 الاختبارات الخاطئة 8 إجمالي التكلفة $0.515 زمن الاستجابة (المتوسط) 26.4s
#60	GPT-5.4 Mini medium	OpenAI	6	7.5	$0.756	12/22	25.9s
إجمالي الاختبارات 22 الاختبارات الخاطئة 10 إجمالي التكلفة $0.756 زمن الاستجابة (المتوسط) 25.9s
#44	Claude Sonnet 4.6 medium	Anthropic	4	7.8	$2.057	14/22	25.9s
إجمالي الاختبارات 22 الاختبارات الخاطئة 8 إجمالي التكلفة $2.057 زمن الاستجابة (المتوسط) 25.9s
#97	KAT-Coder-Pro V2.5 none	Kwaipilot	10	6.7	$0.476	11/22	25.6s
إجمالي الاختبارات 22 الاختبارات الخاطئة 11 إجمالي التكلفة $0.476 زمن الاستجابة (المتوسط) 25.6s
#131	Qwen3.5-Flash none	Qwen	13	6.1	$0.073	8/22	25.3s
إجمالي الاختبارات 22 الاختبارات الخاطئة 14 إجمالي التكلفة $0.073 زمن الاستجابة (المتوسط) 25.3s
#19	Muse Spark 1.1 medium	Meta	4	8.6	$1.357	15/22	25.0s
إجمالي الاختبارات 22 الاختبارات الخاطئة 7 إجمالي التكلفة $1.357 زمن الاستجابة (المتوسط) 25.0s
#159	Hy3 preview low	Tencent	4	5.5	$0.015	10/21	24.6s
إجمالي الاختبارات 21 الاختبارات الخاطئة 11 إجمالي التكلفة $0.015 زمن الاستجابة (المتوسط) 24.6s
#85	KAT-Coder-Pro V2.5 medium	Kwaipilot	9	6.9	$0.467	11/22	24.0s
إجمالي الاختبارات 22 الاختبارات الخاطئة 11 إجمالي التكلفة $0.467 زمن الاستجابة (المتوسط) 24.0s
#191	Grok 4.1 Fast medium	X AI	4	4.7	$0.069	9/19	23.8s
إجمالي الاختبارات 19 الاختبارات الخاطئة 10 إجمالي التكلفة $0.069 زمن الاستجابة (المتوسط) 23.8s
#42	GLM 5.2 medium	Z.ai	3	7.8	$0.187	15/21	23.3s
إجمالي الاختبارات 21 الاختبارات الخاطئة 6 إجمالي التكلفة $0.187 زمن الاستجابة (المتوسط) 23.3s
#21	GPT-5.4 medium	OpenAI	5	8.5	$1.533	15/22	23.1s
إجمالي الاختبارات 22 الاختبارات الخاطئة 7 إجمالي التكلفة $1.533 زمن الاستجابة (المتوسط) 23.1s

إخفاقات إجابة خاطئة

تصفية النماذج

أفضل النماذج حسب عدد إجابة خاطئة

عدد إجابة خاطئة مقابل النتيجة

أفضل النماذج حسب زمن الاستجابة (المتوسط)