خاص بالمجال: إجابة خاطئة
خاص بالمجال
إجابة خاطئة
اكتشف أي نماذج الذكاء الاصطناعي هي الأكثر عرضة لظهور إجابة خاطئة في خاص بالمجال، حتى ترصد نقاط الضعف بسرعة أكبر.
أسباب الفشل
299/299
تصفية النماذج
لا توجد نماذج تطابق البحث والفلاتر الحالية.
| الترتيب | النموذج | الشركة | عدد إجابة خاطئة | درجة الفئة | إجمالي التكلفة | اختبارات صحيحة | زمن الاستجابة (المتوسط) |
|---|---|---|---|---|---|---|---|
| #72 | Gemini 3.5 Flash Lite medium | 3 | 4.1 | $0.272 | 0/3 | 5.34s | |
| #77 | Seed-2.0-Lite medium | Bytedance Seed | 3 | 3.6 | $0.236 | 0/3 | 84.4s |
| #79 | Qwen3.7 Flash high | Qwen | 3 | 2.9 | $0.052 | 0/3 | 34.4s |
| #81 | Seed-2.0-Code low | Bytedance Seed | 3 | 4.1 | $0.767 | 0/3 | 238.4s |
| #83 | DeepSeek V4 Pro high | DeepSeek | 3 | 3.6 | $0.489 | 0/3 | 249.5s |
| #84 | DeepSeek V4 Flash 0423 high | DeepSeek | 3 | 3.6 | $0.039 | 0/3 | 115.4s |
| #87 | Solar Pro 4 xhigh | Upstage | 3 | 3.0 | $0.050 | 0/3 | 287.7s |
| #88 | Nemotron 3 Ultra medium | NVIDIA | 3 | 3.6 | $0.567 | 0/3 | 35.2s |
| #97 | GPT-5.4 Mini medium | OpenAI | 3 | 3.6 | $0.786 | 0/3 | 71.1s |
| #103 | GPT-5.6 Luna medium | OpenAI | 3 | 2.9 | $0.072 | 0/3 | 18.5s |
| #106 | Grok 4.6 low | X AI | 3 | 3.0 | $0.449 | 0/3 | 18.2s |
| #110 | KAT-Coder-Pro V2.5 low | Kwaipilot | 3 | 3.5 | $0.400 | 0/3 | 22.9s |
| #112 | Gemini 3.1 Flash Lite medium | 3 | 2.9 | $0.120 | 0/3 | 3.93s | |
| #114 | DeepSeek V4 Flash 0731 medium | DeepSeek | 3 | 2.9 | $0.066 | 0/3 | 203.1s |
| #117 | KAT-Coder-Pro V2.5 high | Kwaipilot | 3 | 2.9 | $0.506 | 0/3 | 44.7s |