Kegagalan Jawaban salah
Lihat model AI mana yang paling sering mengalami Jawaban salah, agar Anda bisa melihat risiko keandalan sebelum memilih. Urutkan berdasarkan: Total Biaya ↓.
Model yang ditampilkan
15
Total kegagalan
1585
Model yang paling terdampak
Grok 4.20 Multi Agent Beta 4Kategori
Dalam kategori Spesifik domain421 Dalam kategori Trik anti-AI293 Dalam kategori Pemrograman259 Dalam kategori Pemecahan teka-teki204 Dalam kategori Pengetahuan umum172 Dalam kategori Gabungan69 Dalam kategori Kecerdasan umum62 Dalam kategori Kepatuhan instruksi61 Dalam kategori Parsing dan ekstraksi data41 Dalam kategori Pemanggilan alat3
215/215
Filter model
Tidak ada model yang cocok dengan pencarian dan filter saat ini.
| Peringkat | Model | Perusahaan | Jumlah Jawaban salah | Skor | Total Biaya | Tes benar | Waktu respons (rata-rata) |
|---|---|---|---|---|---|---|---|
| #156 | DeepSeek V4 Flash none | DeepSeek | 12 | 5.6 | $0.042 | 5/22 | 36.8s |
| #164 | KAT-Coder-Air V2.5 low | Kwaipilot | 7 | 5.4 | $0.041 | 7/22 | 10.1s |
| #186 | GPT-5.4 Nano none | OpenAI | 15 | 4.8 | $0.041 | 4/22 | 2.57s |
| #147 | GLM 5 none | Z.ai | 12 | 5.7 | $0.041 | 9/21 | 4.03s |
| #49 | DeepSeek V4 Flash high | DeepSeek | 6 | 7.7 | $0.041 | 13/22 | 49.7s |
| #210 | Qwen3.5-9B medium | Qwen | 2 | 3.8 | $0.036 | 3/22 | 82.2s |
| #192 | Laguna M.1 medium | Poolside | 4 | 4.7 | $0.033 | 9/19 | 14.7s |
| #193 | Qwen3 Coder Next medium | Qwen | 13 | 4.7 | $0.032 | 4/22 | 9.61s |
| #195 | Mercury 2 none | Inception | 17 | 4.6 | $0.030 | 4/22 | 829ms |
| #185 | Ring-2.6-1T none | Inclusionai | 5 | 4.8 | $0.026 | 9/22 | 55.1s |
| #174 | MiMo-V2.5 none | Xiaomi | 14 | 5.1 | $0.025 | 5/22 | 4.62s |
| #206 | MiMo-V2-Flash none | Xiaomi | 13 | 4.0 | $0.025 | 4/21 | 2.76s |
| #172 | Qwen3 Coder Next none | Qwen | 14 | 5.1 | $0.025 | 5/22 | 9.12s |
| #171 | Mistral Small 4 none | Mistral | 16 | 5.1 | $0.022 | 5/22 | 1.20s |
| #163 | Mimo V2 Omni none | Xiaomi | 10 | 5.5 | $0.021 | 8/21 | 2.44s |