ترتيب إخفاقات إجابة خاطئة

اكتشف أي نماذج الذكاء الاصطناعي تواجه إجابة خاطئة أكثر من غيرها، حتى ترى مخاطر الاعتمادية قبل الاختيار. الترتيب حسب: اختبارات صحيحة ↓.

النماذج المعروضة

إجمالي الإخفاقات

1558

النموذج الأكثر تأثرًا

Gemini 3 Flash Preview 1

الفئات

ضمن الفئة خاص بالمجال412 ضمن الفئة حيل مضادة للذكاء الاصطناعي293 ضمن الفئة البرمجة252 ضمن الفئة حل الألغاز201 ضمن الفئة معلومات عامة168 ضمن الفئة مجمّع68 ضمن الفئة اتباع التعليمات61 ضمن الفئة الذكاء العام59 ضمن الفئة تحليل البيانات واستخراجها41 ضمن الفئة استدعاء الأدوات3

209/209

الترتيب	النموذج	الشركة	عدد إجابة خاطئة	النتيجة	إجمالي التكلفة	اختبارات صحيحة	زمن الاستجابة (المتوسط)
#131	Grok 4.20 Beta medium	X AI	3	6.0	$0.750	14/18	9.75s
إجمالي الاختبارات 18 الاختبارات الخاطئة 4 إجمالي التكلفة $0.750 زمن الاستجابة (المتوسط) 9.75s
#12	Grok 4.5 high	X AI	2	8.9	$1.707	17/22	76.5s
إجمالي الاختبارات 22 الاختبارات الخاطئة 5 إجمالي التكلفة $1.707 زمن الاستجابة (المتوسط) 76.5s
#17	Claude Fable 5 medium	Anthropic	2	8.6	$3.478	17/22	17.2s
إجمالي الاختبارات 22 الاختبارات الخاطئة 5 إجمالي التكلفة $3.478 زمن الاستجابة (المتوسط) 17.2s
#13	GPT-5.3-Codex medium	OpenAI	4	8.9	$0.920	16/22	17.0s
إجمالي الاختبارات 22 الاختبارات الخاطئة 6 إجمالي التكلفة $0.920 زمن الاستجابة (المتوسط) 17.0s
#19	Qwen3.6 Max Preview medium	Qwen	5	8.4	$1.143	16/22	67.5s
إجمالي الاختبارات 22 الاختبارات الخاطئة 6 إجمالي التكلفة $1.143 زمن الاستجابة (المتوسط) 67.5s
#20	Grok 4.5 low	X AI	6	8.4	$0.935	16/22	15.6s
إجمالي الاختبارات 22 الاختبارات الخاطئة 6 إجمالي التكلفة $0.935 زمن الاستجابة (المتوسط) 15.6s
#22	Grok 4.5 medium	X AI	6	8.3	$1.928	16/22	61.7s
إجمالي الاختبارات 22 الاختبارات الخاطئة 6 إجمالي التكلفة $1.928 زمن الاستجابة (المتوسط) 61.7s
#23	Claude Sonnet 5 medium	Anthropic	4	8.3	$0.922	16/22	12.5s
إجمالي الاختبارات 22 الاختبارات الخاطئة 6 إجمالي التكلفة $0.922 زمن الاستجابة (المتوسط) 12.5s
#41	Claude Opus 4.8 low	Anthropic	4	7.8	$2.077	16/22	12.7s
إجمالي الاختبارات 22 الاختبارات الخاطئة 6 إجمالي التكلفة $2.077 زمن الاستجابة (المتوسط) 12.7s
#61	Gemini 3 Flash Preview low	Google	6	7.4	$0.177	16/22	6.28s
إجمالي الاختبارات 22 الاختبارات الخاطئة 6 إجمالي التكلفة $0.177 زمن الاستجابة (المتوسط) 6.28s
#38	GLM 5.2 medium	Z.ai	3	7.8	$0.222	15/21	23.3s
إجمالي الاختبارات 21 الاختبارات الخاطئة 6 إجمالي التكلفة $0.222 زمن الاستجابة (المتوسط) 23.3s
#42	GLM 5 medium	Z.ai	3	7.7	$0.307	15/21	33.5s
إجمالي الاختبارات 21 الاختبارات الخاطئة 6 إجمالي التكلفة $0.307 زمن الاستجابة (المتوسط) 33.5s
#16	Muse Spark 1.1 medium	Meta	4	8.6	$1.357	15/22	25.0s
إجمالي الاختبارات 22 الاختبارات الخاطئة 7 إجمالي التكلفة $1.357 زمن الاستجابة (المتوسط) 25.0s
#18	GPT-5.4 medium	OpenAI	5	8.5	$1.533	15/22	23.1s
إجمالي الاختبارات 22 الاختبارات الخاطئة 7 إجمالي التكلفة $1.533 زمن الاستجابة (المتوسط) 23.1s
#25	Gemini 2.5 Flash medium	Google	6	8.2	$0.643	15/22	21.2s
إجمالي الاختبارات 22 الاختبارات الخاطئة 7 إجمالي التكلفة $0.643 زمن الاستجابة (المتوسط) 21.2s

إخفاقات إجابة خاطئة

تصفية النماذج

أفضل النماذج حسب عدد إجابة خاطئة

عدد إجابة خاطئة مقابل النتيجة

أفضل النماذج حسب زمن الاستجابة (المتوسط)