إخفاقات الفئات في AI BENCHY
حيل مضادة للذكاء الاصطناعي: إجابة خاطئة
حيل مضادة للذكاء الاصطناعي
إجابة خاطئة
اكتشف أي نماذج الذكاء الاصطناعي هي الأكثر عرضة لظهور إجابة خاطئة في حيل مضادة للذكاء الاصطناعي، حتى ترصد نقاط الضعف بسرعة أكبر. الترتيب حسب: اختبارات صحيحة ↓.
| الترتيب | النموذج | الشركة | عدد إجابة خاطئة | درجة الفئة | اختبارات صحيحة | زمن الاستجابة (المتوسط) |
|---|---|---|---|---|---|---|
| #8 | Claude Opus 4.7 none | Anthropic | 1 | 8.3 | 3/4 | 2.12s |
| #11 | Claude Opus 4.7 medium | Anthropic | 1 | 8.3 | 3/4 | 1.85s |
| #13 | Grok 4.20 Beta medium | X AI | 1 | 8.7 | 3/4 | 3.16s |
| #15 | GPT-5.3-Codex medium | OpenAI | 1 | 8.7 | 3/4 | 4.16s |
| #19 | Seed-2.0-Lite medium | Bytedance Seed | 1 | 8.3 | 3/4 | 18.0s |
| #21 | GPT-5.4 medium | OpenAI | 1 | 8.3 | 3/4 | 4.11s |
| #24 | GPT-5.2 Chat none | OpenAI | 1 | 8.7 | 3/4 | 3.40s |
| #25 | Qwen3.5 Plus 2026-02-15 medium | Qwen | 1 | 8.2 | 3/4 | 45.8s |
| #28 | Gemini 2.5 Flash medium | 1 | 8.4 | 3/4 | 6.30s | |
| #31 | DeepSeek V4 Flash high | DeepSeek | 1 | 8.3 | 3/4 | 28.5s |
| #45 | GPT-5.4 Mini medium | OpenAI | 1 | 8.6 | 3/4 | 4.05s |
| #48 | Gemini 3 Flash Preview none | 1 | 8.3 | 3/4 | 1.25s | |
| #50 | Gemini 3.1 Flash Lite Preview low | 1 | 8.3 | 3/4 | 2.12s | |
| #53 | Gemini 3.1 Flash Lite high | 1 | 8.7 | 3/4 | 37.2s | |
| #57 | Step 3.7 Flash low | Stepfun | 1 | 8.7 | 3/4 | 4.02s |