خاص بالمجال: إجابة خاطئة
خاص بالمجال
إجابة خاطئة
اكتشف أي نماذج الذكاء الاصطناعي هي الأكثر عرضة لظهور إجابة خاطئة في خاص بالمجال، حتى ترصد نقاط الضعف بسرعة أكبر. الترتيب حسب: زمن الاستجابة (المتوسط) ↓.
أسباب الفشل
299/299
تصفية النماذج
لا توجد نماذج تطابق البحث والفلاتر الحالية.
| الترتيب | النموذج | الشركة | عدد إجابة خاطئة | درجة الفئة | إجمالي التكلفة | اختبارات صحيحة | زمن الاستجابة (المتوسط) |
|---|---|---|---|---|---|---|---|
| #49 | Seed 2.1 Turbo medium | Bytedance Seed | 3 | 2.9 | $1.951 | 0/3 | 656.0s |
| #48 | Qwen3.8 27B high | Qwen | 1 | 5.3 | ~$0.287 | 1/3 | 526.7s |
| #27 | Seed 2.1 Turbo high | Bytedance Seed | 2 | 2.9 | $1.797 | 0/3 | 506.2s |
| #228 | Hy4 preview low | Tencent | 2 | 4.5 | $1.745 | 0/3 | 470.2s |
| #62 | DeepSeek V4 Flash 0731 high | DeepSeek | 2 | 3.5 | $0.084 | 0/3 | 458.6s |
| #155 | LongCat 2.0 high | Meituan | 2 | 3.6 | $0.492 | 0/3 | 433.7s |
| #142 | Seed-2.0-Code medium | Bytedance Seed | 2 | 5.3 | $1.153 | 1/3 | 429.8s |
| #18 | Seed 2.1 Turbo low | Bytedance Seed | 1 | 2.9 | $1.546 | 0/3 | 424.5s |
| #138 | Seed-2.0-Code high | Bytedance Seed | 2 | 3.5 | $1.273 | 0/3 | 419.7s |
| #104 | LongCat 2.0 medium | Meituan | 2 | 3.0 | $0.499 | 0/3 | 390.6s |
| #12 | Grok 4.6 high | X AI | 2 | 5.3 | $1.908 | 1/3 | 369.9s |
| #202 | Step 3.5 Flash medium | Stepfun | 3 | 3.5 | $0.132 | 0/3 | 311.6s |
| #45 | Grok 4.6 medium | X AI | 2 | 5.3 | $1.713 | 1/3 | 304.3s |
| #24 | Grok 4.5 high | X AI | 2 | 4.1 | $2.252 | 0/3 | 301.3s |
| #105 | Qwen3.8 2.4T A95B high | Qwen | 2 | 4.1 | $2.357 | 0/3 | 301.1s |