البرمجة: إجابة خاطئة
البرمجة
إجابة خاطئة
اكتشف أي نماذج الذكاء الاصطناعي هي الأكثر عرضة لظهور إجابة خاطئة في البرمجة، حتى ترصد نقاط الضعف بسرعة أكبر.
أسباب الفشل
265/265
تصفية النماذج
لا توجد نماذج تطابق البحث والفلاتر الحالية.
| الترتيب | النموذج | الشركة | عدد إجابة خاطئة | درجة الفئة | إجمالي التكلفة | اختبارات صحيحة | زمن الاستجابة (المتوسط) |
|---|---|---|---|---|---|---|---|
| #186 | Grok 4.7 xhigh | X AI | 1 | 0.5 | $3.398 | 1/3 | 414.5s |
| #187 | Grok Build 0.1 medium | X AI | 1 | 0.6 | $1.419 | 1/3 | 108.5s |
| #189 | Solar Pro 4 low | Upstage | 1 | 0.5 | $0.101 | 1/3 | 259.6s |
| #190 | Grok 4.7 high | X AI | 1 | 0.6 | $3.037 | 1/3 | 335.9s |
| #200 | LongCat 2.0 low | Meituan | 1 | 0.7 | $0.630 | 1/3 | 479.3s |
| #201 | Mercury 2 medium | Inception | 1 | 0.8 | $0.121 | 2/3 | 2.04s |
| #202 | Step 3.7 Flash high | Stepfun | 1 | 0.4 | $1.478 | 0/3 | 206.2s |
| #203 | KAT-Coder-Pro V2.5 low | Kwaipilot | 1 | 0.8 | $0.568 | 2/3 | 24.9s |
| #206 | Mercury 2.5 Preview high | Inception | 1 | 0.7 | $0.040 | 1/3 | 6.13s |
| #211 | Grok 4.3 medium | X AI | 1 | 0.6 | $0.989 | 1/3 | 41.2s |
| #215 | Solar Pro 4 medium | Upstage | 1 | 0.5 | $0.098 | 1/3 | 310.4s |
| #216 | Claude Sonnet 4.6 medium | Anthropic | 1 | 0.6 | $2.126 | 1/3 | 33.3s |
| #219 | Gemini 3.5 Flash minimal | 1 | 0.6 | $0.508 | 1/3 | 2.75s | |
| #224 | Qwen3.5-35B-A3B medium | Qwen | 1 | 0.6 | $0.716 | 1/3 | 206.6s |
| #229 | Solar Pro 4 high | Upstage | 1 | 0.6 | $0.077 | 1/3 | 244.7s |