Verkeerd antwoord-fouten
Zie welke AI-modellen het vaakst tegen Verkeerd antwoord aanlopen, zodat je betrouwbaarheidsrisico's ziet voordat je kiest. Sorteren op: Totale kosten โ.
Categorieรซn
In categorie Domeinspecifiek421 In categorie Anti-AI-trucs293 In categorie Programmeren259 In categorie Puzzeloplossing204 In categorie Algemene kennis172 In categorie Gecombineerd69 In categorie Algemene intelligentie62 In categorie Instructies opvolgen61 In categorie Gegevensparsering en extractie41 In categorie Toolaanroepen3
215/215
Modellen filteren
Geen modellen komen overeen met de huidige zoekopdracht en filters.
| Rang | Model | Bedrijf | Verkeerd antwoord-aantal | Score | Totale kosten | Correcte tests | Responstijd (gem.) |
|---|---|---|---|---|---|---|---|
| #65 | Gemini 3 Flash Preview low | 6 | 7.4 | $0.177 | 16/22 | 6.28s | |
| #144 | Kimi K2.6 none | Moonshot AI | 11 | 5.8 | $0.184 | 7/22 | 19.6s |
| #129 | Inkling low | Thinkingmachines | 8 | 6.1 | $0.187 | 10/22 | 5.15s |
| #88 | MiMo-V2.5-Pro medium | Xiaomi | 3 | 6.9 | $0.187 | 12/22 | 33.9s |
| #42 | GLM 5.2 medium | Z.ai | 3 | 7.8 | $0.187 | 15/21 | 23.3s |
| #63 | Qwen3.7 Max none | Qwen | 7 | 7.4 | $0.197 | 15/22 | 4.52s |
| #50 | DeepSeek V4 Pro high | DeepSeek | 6 | 7.7 | $0.200 | 10/22 | 79.1s |
| #103 | Qwen3.6 Max Preview none | Qwen | 10 | 6.6 | $0.231 | 12/22 | 7.82s |
| #39 | Seed-2.0-Lite medium | Bytedance Seed | 5 | 7.9 | $0.234 | 14/22 | 48.5s |
| #29 | GPT-5 Mini medium | OpenAI | 5 | 8.1 | $0.237 | 12/22 | 27.6s |
| #148 | Qwen3.5-122B-A10B none | Qwen | 13 | 5.7 | $0.247 | 6/22 | 12.9s |
| #123 | GPT-5.6 Luna low | OpenAI | 10 | 6.2 | $0.249 | 10/22 | 5.04s |
| #40 | Qwen3.7 Plus medium | Qwen | 5 | 7.9 | $0.267 | 15/22 | 51.5s |
| #51 | MiniMax M3 medium | Minimax | 3 | 7.6 | $0.286 | 12/22 | 75.0s |
| #92 | Gemini 3.5 Flash minimal | 5 | 6.8 | $0.300 | 14/22 | 2.65s |