Verkeerd antwoord-fouten
Zie welke AI-modellen het vaakst tegen Verkeerd antwoord aanlopen, zodat je betrouwbaarheidsrisico's ziet voordat je kiest. Sorteren op: Totale kosten โ.
Categorieรซn
In categorie Domeinspecifiek421 In categorie Anti-AI-trucs293 In categorie Programmeren259 In categorie Puzzeloplossing204 In categorie Algemene kennis172 In categorie Gecombineerd69 In categorie Algemene intelligentie62 In categorie Instructies opvolgen61 In categorie Gegevensparsering en extractie41 In categorie Toolaanroepen3
215/215
Modellen filteren
Geen modellen komen overeen met de huidige zoekopdracht en filters.
| Rang | Model | Bedrijf | Verkeerd antwoord-aantal | Score | Totale kosten | Correcte tests | Responstijd (gem.) |
|---|---|---|---|---|---|---|---|
| #196 | MiniMax M2.5 medium | Minimax | 7 | 4.6 | $0.340 | 5/22 | 68.3s |
| #115 | Mimo V2 PRO medium | Xiaomi | 5 | 6.3 | $0.333 | 12/21 | 22.2s |
| #53 | GLM 5 Turbo medium | Z.ai | 4 | 7.6 | $0.323 | 14/21 | 23.0s |
| #74 | Qwen3.5 Plus 2026-04-20 medium | Qwen | 8 | 7.2 | $0.317 | 13/22 | 46.4s |
| #46 | GLM 5 medium | Z.ai | 3 | 7.7 | $0.307 | 15/21 | 33.5s |
| #92 | Gemini 3.5 Flash minimal | 5 | 6.8 | $0.300 | 14/22 | 2.65s | |
| #51 | MiniMax M3 medium | Minimax | 3 | 7.6 | $0.286 | 12/22 | 75.0s |
| #40 | Qwen3.7 Plus medium | Qwen | 5 | 7.9 | $0.267 | 15/22 | 51.5s |
| #123 | GPT-5.6 Luna low | OpenAI | 10 | 6.2 | $0.249 | 10/22 | 5.04s |
| #148 | Qwen3.5-122B-A10B none | Qwen | 13 | 5.7 | $0.247 | 6/22 | 12.9s |
| #29 | GPT-5 Mini medium | OpenAI | 5 | 8.1 | $0.237 | 12/22 | 27.6s |
| #39 | Seed-2.0-Lite medium | Bytedance Seed | 5 | 7.9 | $0.234 | 14/22 | 48.5s |
| #103 | Qwen3.6 Max Preview none | Qwen | 10 | 6.6 | $0.231 | 12/22 | 7.82s |
| #50 | DeepSeek V4 Pro high | DeepSeek | 6 | 7.7 | $0.200 | 10/22 | 79.1s |
| #63 | Qwen3.7 Max none | Qwen | 7 | 7.4 | $0.197 | 15/22 | 4.52s |