البرمجة: إجابة خاطئة
البرمجة
إجابة خاطئة
اكتشف أي نماذج الذكاء الاصطناعي هي الأكثر عرضة لظهور إجابة خاطئة في البرمجة، حتى ترصد نقاط الضعف بسرعة أكبر.
أسباب الفشل
197/197
تصفية النماذج
لا توجد نماذج تطابق البحث والفلاتر الحالية.
| الترتيب | النموذج | الشركة | عدد إجابة خاطئة | درجة الفئة | إجمالي التكلفة | اختبارات صحيحة | زمن الاستجابة (المتوسط) |
|---|---|---|---|---|---|---|---|
| #173 | Gemini 3.1 Flash Lite none | 2 | 5.5 | $0.046 | 1/3 | 938ms | |
| #174 | Qwen3.5-Flash medium | Qwen | 2 | 3.7 | $0.142 | 0/3 | 58.9s |
| #177 | Qwen3.6 Flash none | Qwen | 2 | 5.4 | $0.062 | 1/3 | 1.79s |
| #178 | Gemma 4 31B none | 2 | 5.5 | $0.016 | 1/3 | 11.2s | |
| #179 | Qwen3.5 Plus 2026-04-20 none | Qwen | 2 | 3.9 | $0.122 | 0/3 | 1.69s |
| #180 | Nemotron 3 Ultra none | NVIDIA | 2 | 5.5 | $0.095 | 1/3 | 1.02s |
| #182 | Gemini 2.5 Flash none | 2 | 5.5 | $0.017 | 1/3 | 736ms | |
| #184 | GPT-5.6 Terra none | OpenAI | 2 | 5.5 | $0.280 | 1/3 | 1.00s |
| #186 | GPT-5 Nano medium | OpenAI | 2 | 7.0 | $0.118 | 1/3 | 41.6s |
| #187 | Qwen3.5-Flash none | Qwen | 2 | 5.5 | $0.073 | 1/3 | 850ms |
| #188 | Qwen3.5-35B-A3B none | Qwen | 2 | 5.5 | $0.142 | 1/3 | 1.39s |
| #193 | GPT-5.4 Mini none | OpenAI | 2 | 5.5 | $0.095 | 1/3 | 913ms |
| #195 | GPT-5.4 none | OpenAI | 2 | 5.5 | $0.397 | 1/3 | 1.62s |
| #196 | Solar Pro 4 none | Upstage | 2 | 5.5 | $0.006 | 1/3 | 2.61s |
| #201 | Ling-3.0-flash none | Inclusionai | 2 | 5.5 | $0.004 | 1/3 | 6.39s |