البرمجة: إجابة خاطئة
البرمجة
إجابة خاطئة
اكتشف أي نماذج الذكاء الاصطناعي هي الأكثر عرضة لظهور إجابة خاطئة في البرمجة، حتى ترصد نقاط الضعف بسرعة أكبر. الترتيب حسب: إجمالي التكلفة ↓.
أسباب الفشل
265/265
تصفية النماذج
لا توجد نماذج تطابق البحث والفلاتر الحالية.
| الترتيب | النموذج | الشركة | عدد إجابة خاطئة | درجة الفئة | إجمالي التكلفة | اختبارات صحيحة | زمن الاستجابة (المتوسط) |
|---|---|---|---|---|---|---|---|
| #30 | GPT-5.5 medium | OpenAI | 1 | 0.9 | $4.809 | 2/3 | 59.8s |
| #78 | GLM 5.2 high | Z.ai | 2 | 0.6 | $4.632 | 1/3 | 73.0s |
| #153 | Claude Opus 4.8 low | Anthropic | 1 | 0.7 | $3.787 | 1/3 | 7.58s |
| #93 | Claude Opus 4.7 medium | Anthropic | 1 | 0.8 | $3.636 | 2/3 | 13.0s |
| #104 | Claude Fable 5.1 high | Anthropic | 1 | 0.8 | $3.471 | 2/3 | 13.9s |
| #186 | Grok 4.7 xhigh | X AI | 1 | 0.5 | $3.398 | 1/3 | 414.5s |
| #143 | Claude Fable 5.1 medium | Anthropic | 2 | 0.7 | $3.197 | 1/3 | 11.0s |
| #190 | Grok 4.7 high | X AI | 1 | 0.6 | $3.037 | 1/3 | 335.9s |
| #111 | Grok 4.5 medium | X AI | 1 | 0.8 | $2.996 | 2/3 | 155.7s |
| #144 | Grok 4.7 medium | X AI | 1 | 0.7 | $2.938 | 1/3 | 312.2s |
| #159 | Claude Opus 5 none | Anthropic | 1 | 0.6 | $2.766 | 1/3 | 5.54s |
| #43 | Claude Opus 5 low | Anthropic | 1 | 0.8 | $2.350 | 2/3 | 6.70s |
| #178 | Claude Opus 4.8 none | Anthropic | 1 | 0.5 | $2.334 | 1/3 | 3.29s |
| #114 | Grok 4.6 medium | X AI | 1 | 0.8 | $2.270 | 2/3 | 120.0s |
| #51 | GPT-5.4 medium | OpenAI | 1 | 0.9 | $2.213 | 2/3 | 44.4s |