إخفاقات إجابة خاطئة
اكتشف أي نماذج الذكاء الاصطناعي تواجه إجابة خاطئة أكثر من غيرها، حتى ترى مخاطر الاعتمادية قبل الاختيار. الترتيب حسب: النتيجة ↑.
215/215
تصفية النماذج
لا توجد نماذج تطابق البحث والفلاتر الحالية.
| الترتيب | النموذج | الشركة | عدد إجابة خاطئة | النتيجة | إجمالي التكلفة | اختبارات صحيحة | زمن الاستجابة (المتوسط) |
|---|---|---|---|---|---|---|---|
| #5 | GPT-5.6 Sol low | OpenAI | 4 | 9.5 | $0.971 | 18/22 | 8.79s |
| #4 | Gemini 3.5 Flash high | 1 | 9.5 | $1.976 | 20/22 | 15.1s | |
| #3 | Gemini 3 Flash Preview medium | 1 | 9.6 | $0.742 | 21/22 | 19.2s | |
| #2 | Gemini 3.6 Flash high | 1 | 9.7 | $1.785 | 21/22 | 14.9s | |
| #1 | Gemini 3.6 Flash medium | 1 | 9.9 | $0.831 | 21/22 | 10.1s |