Verkeerd antwoord-fouten
Zie welke AI-modellen het vaakst tegen Verkeerd antwoord aanlopen, zodat je betrouwbaarheidsrisico's ziet voordat je kiest. Sorteren op: Totale kosten โ.
Categorieรซn
In categorie Domeinspecifiek421 In categorie Anti-AI-trucs293 In categorie Programmeren259 In categorie Puzzeloplossing204 In categorie Algemene kennis172 In categorie Gecombineerd69 In categorie Algemene intelligentie62 In categorie Instructies opvolgen61 In categorie Gegevensparsering en extractie41 In categorie Toolaanroepen3
215/215
Modellen filteren
Geen modellen komen overeen met de huidige zoekopdracht en filters.
| Rang | Model | Bedrijf | Verkeerd antwoord-aantal | Score | Totale kosten | Correcte tests | Responstijd (gem.) |
|---|---|---|---|---|---|---|---|
| #156 | DeepSeek V4 Flash none | DeepSeek | 12 | 5.6 | $0.042 | 5/22 | 36.8s |
| #164 | KAT-Coder-Air V2.5 low | Kwaipilot | 7 | 5.4 | $0.041 | 7/22 | 10.1s |
| #186 | GPT-5.4 Nano none | OpenAI | 15 | 4.8 | $0.041 | 4/22 | 2.57s |
| #147 | GLM 5 none | Z.ai | 12 | 5.7 | $0.041 | 9/21 | 4.03s |
| #49 | DeepSeek V4 Flash high | DeepSeek | 6 | 7.7 | $0.041 | 13/22 | 49.7s |
| #210 | Qwen3.5-9B medium | Qwen | 2 | 3.8 | $0.036 | 3/22 | 82.2s |
| #192 | Laguna M.1 medium | Poolside | 4 | 4.7 | $0.033 | 9/19 | 14.7s |
| #193 | Qwen3 Coder Next medium | Qwen | 13 | 4.7 | $0.032 | 4/22 | 9.61s |
| #195 | Mercury 2 none | Inception | 17 | 4.6 | $0.030 | 4/22 | 829ms |
| #185 | Ring-2.6-1T none | Inclusionai | 5 | 4.8 | $0.026 | 9/22 | 55.1s |
| #174 | MiMo-V2.5 none | Xiaomi | 14 | 5.1 | $0.025 | 5/22 | 4.62s |
| #206 | MiMo-V2-Flash none | Xiaomi | 13 | 4.0 | $0.025 | 4/21 | 2.76s |
| #172 | Qwen3 Coder Next none | Qwen | 14 | 5.1 | $0.025 | 5/22 | 9.12s |
| #171 | Mistral Small 4 none | Mistral | 16 | 5.1 | $0.022 | 5/22 | 1.20s |
| #163 | Mimo V2 Omni none | Xiaomi | 10 | 5.5 | $0.021 | 8/21 | 2.44s |