Kegagalan Jawaban salah
Lihat model AI mana yang paling sering mengalami Jawaban salah, agar Anda bisa melihat risiko keandalan sebelum memilih. Urutkan berdasarkan: Tes benar ↓.
Kategori
Dalam kategori Spesifik domain421 Dalam kategori Trik anti-AI293 Dalam kategori Pemrograman259 Dalam kategori Pemecahan teka-teki204 Dalam kategori Pengetahuan umum172 Dalam kategori Gabungan69 Dalam kategori Kecerdasan umum62 Dalam kategori Kepatuhan instruksi61 Dalam kategori Parsing dan ekstraksi data41 Dalam kategori Pemanggilan alat3
215/215
Filter model
Tidak ada model yang cocok dengan pencarian dan filter saat ini.
| Peringkat | Model | Perusahaan | Jumlah Jawaban salah | Skor | Total Biaya | Tes benar | Waktu respons (rata-rata) |
|---|---|---|---|---|---|---|---|
| #132 | Qwen3.5 Plus 2026-04-20 none | Qwen | 12 | 6.1 | $0.122 | 8/22 | 13.6s |
| #135 | Nemotron 3 Ultra none | NVIDIA | 12 | 6.1 | $0.095 | 8/22 | 3.87s |
| #138 | GPT-5.6 Terra none | OpenAI | 11 | 6.0 | $0.349 | 8/22 | 1.65s |
| #146 | Nemotron 3 Super medium | NVIDIA | 5 | 5.7 | $0.055 | 8/22 | 52.0s |
| #155 | KAT-Coder-Air V2.5 medium | Kwaipilot | 11 | 5.6 | $0.048 | 8/22 | 8.42s |
| #162 | Gemma 4 26B A4B none | 10 | 5.5 | $0.015 | 8/22 | 7.64s | |
| #153 | Mimo V2 PRO none | Xiaomi | 11 | 5.6 | $0.045 | 7/21 | 2.27s |
| #154 | Owl Alpha none | Openrouter | 10 | 5.6 | $0.000 | 7/21 | 9.88s |
| #194 | Cobuddy medium | Baidu | 9 | 4.7 | $0.000 | 7/21 | 39.9s |
| #197 | Grok 4.20 Beta none | X AI | 10 | 4.4 | $0.087 | 6/18 | 1.19s |
| #202 | Hunter Alpha none | OpenRouter | 9 | 4.2 | $0.000 | 6/18 | 4.70s |
| #203 | Grok 4.20 none | X AI | 10 | 4.1 | $0.057 | 6/18 | 1.11s |
| #117 | LongCat 2.0 none | Meituan | 14 | 6.3 | $0.044 | 7/22 | 5.18s |
| #130 | Qwen3.6 Flash none | Qwen | 12 | 6.1 | $0.062 | 7/22 | 3.74s |
| #133 | Qwen3.5-35B-A3B none | Qwen | 12 | 6.1 | $0.106 | 7/22 | 12.7s |