حيل مضادة للذكاء الاصطناعي: إجابة خاطئة
حيل مضادة للذكاء الاصطناعي
إجابة خاطئة
اكتشف أي نماذج الذكاء الاصطناعي هي الأكثر عرضة لظهور إجابة خاطئة في حيل مضادة للذكاء الاصطناعي، حتى ترصد نقاط الضعف بسرعة أكبر.
أسباب الفشل
188/188
تصفية النماذج
لا توجد نماذج تطابق البحث والفلاتر الحالية.
| الترتيب | النموذج | الشركة | عدد إجابة خاطئة | درجة الفئة | إجمالي التكلفة | اختبارات صحيحة | زمن الاستجابة (المتوسط) |
|---|---|---|---|---|---|---|---|
| #123 | Muse Glimmer 30B high | Meta | 1 | 8.7 | $0.397 | 3/4 | 13.2s |
| #126 | Muse Glimmer 30B medium | Meta | 1 | 9.2 | $0.211 | 3/4 | 7.36s |
| #128 | Muse Glimmer 30B low | Meta | 1 | 8.7 | $0.143 | 3/4 | 3.57s |
| #129 | Step 3.7 Flash low | Stepfun | 1 | 8.7 | $0.390 | 3/4 | 4.02s |
| #132 | GPT-5.6 Sol none | OpenAI | 1 | 8.3 | $0.201 | 3/4 | 1.27s |
| #136 | Mercury 2 medium | Inception | 1 | 6.9 | $0.094 | 2/4 | 1.12s |
| #137 | Grok 4.20 medium | X AI | 1 | 8.2 | $0.805 | 3/4 | 3.95s |
| #138 | Seed-2.0-Mini medium | Bytedance Seed | 1 | 6.6 | $0.116 | 2/4 | 74.7s |
| #139 | Kimi K2.5 medium | Moonshot AI | 1 | 7.3 | $0.479 | 2/4 | 51.4s |
| #140 | KAT-Coder-Pro V2.5 medium | Kwaipilot | 1 | 8.2 | $0.478 | 3/4 | 3.90s |
| #143 | Seed-2.0-Code high | Bytedance Seed | 1 | 8.3 | $1.273 | 3/4 | 35.1s |
| #147 | Seed-2.0-Code medium | Bytedance Seed | 1 | 6.9 | $1.153 | 2/4 | 46.0s |
| #153 | Gemini 3 Flash Preview none | 1 | 8.3 | $0.085 | 3/4 | 1.25s | |
| #155 | GLM 5.2 none | Z.ai | 1 | 8.3 | $0.153 | 3/4 | 3.70s |
| #156 | KAT-Coder-Pro V2.5 none | Kwaipilot | 1 | 8.7 | $0.487 | 3/4 | 4.58s |