إخفاقات إجابة خاطئة
اكتشف أي نماذج الذكاء الاصطناعي تواجه إجابة خاطئة أكثر من غيرها، حتى ترى مخاطر الاعتمادية قبل الاختيار. الترتيب حسب: زمن الاستجابة (المتوسط) ↓.
215/215
تصفية النماذج
لا توجد نماذج تطابق البحث والفلاتر الحالية.
| الترتيب | النموذج | الشركة | عدد إجابة خاطئة | النتيجة | إجمالي التكلفة | اختبارات صحيحة | زمن الاستجابة (المتوسط) |
|---|---|---|---|---|---|---|---|
| #43 | GPT-5.6 Terra medium | OpenAI | 8 | 7.8 | $0.676 | 14/22 | 7.11s |
| #58 | GPT-5.3 Chat none | OpenAI | 7 | 7.5 | $0.571 | 13/22 | 6.88s |
| #204 | Laguna Xs.2 medium | Poolside | 6 | 4.1 | $0.015 | 6/19 | 6.73s |
| #157 | GLM 5.1 none | Z.ai | 13 | 5.5 | $0.164 | 7/22 | 6.70s |
| #65 | Gemini 3 Flash Preview low | 6 | 7.4 | $0.177 | 16/22 | 6.28s | |
| #124 | Gemini 2.5 Flash none | 12 | 6.2 | $0.017 | 9/22 | 6.20s | |
| #118 | Claude Sonnet 5 none | Anthropic | 7 | 6.3 | $0.548 | 8/22 | 6.04s |
| #104 | Gemini 3.5 Flash-Lite medium | 9 | 6.5 | $0.369 | 12/22 | 6.01s | |
| #183 | Nemotron 3 Super none | NVIDIA | 15 | 4.9 | $0.008 | 5/22 | 5.97s |
| #14 | Gemini 3.5 Flash low | 2 | 8.9 | $0.433 | 19/22 | 5.55s | |
| #167 | Qwen3.6 35B A3B none | Qwen | 13 | 5.3 | $0.061 | 4/22 | 5.52s |
| #121 | Gemma 4 31B none | 9 | 6.2 | $0.021 | 10/22 | 5.34s | |
| #59 | GPT-5.6 Terra low | OpenAI | 8 | 7.5 | $0.519 | 13/22 | 5.31s |
| #117 | LongCat 2.0 none | Meituan | 14 | 6.3 | $0.044 | 7/22 | 5.18s |
| #129 | Inkling low | Thinkingmachines | 8 | 6.1 | $0.187 | 10/22 | 5.15s |