Verkeerd antwoord-fouten
Zie welke AI-modellen het vaakst tegen Verkeerd antwoord aanlopen, zodat je betrouwbaarheidsrisico's ziet voordat je kiest. Sorteren op: Score โ.
Categorieรซn
In categorie Domeinspecifiek421 In categorie Anti-AI-trucs293 In categorie Programmeren259 In categorie Puzzeloplossing204 In categorie Algemene kennis172 In categorie Gecombineerd69 In categorie Algemene intelligentie62 In categorie Instructies opvolgen61 In categorie Gegevensparsering en extractie41 In categorie Toolaanroepen3
215/215
Modellen filteren
Geen modellen komen overeen met de huidige zoekopdracht en filters.
| Rang | Model | Bedrijf | Verkeerd antwoord-aantal | Score | Totale kosten | Correcte tests | Responstijd (gem.) |
|---|---|---|---|---|---|---|---|
| #35 | GLM 5.2 high | Z.ai | 3 | 8.0 | $0.817 | 14/22 | 62.7s |
| #33 | Step 3.7 Flash medium | Stepfun | 5 | 8.0 | $0.515 | 14/22 | 26.4s |
| #34 | GPT-5.2 Chat none | OpenAI | 6 | 8.0 | $0.604 | 14/22 | 7.65s |
| #32 | Inkling high | Thinkingmachines | 4 | 8.0 | $1.006 | 15/22 | 64.2s |
| #31 | Gemini 3.5 Flash-Lite high | 6 | 8.1 | $0.584 | 14/22 | 9.48s | |
| #30 | Muse Spark 1.1 high | Meta | 4 | 8.1 | $1.694 | 12/22 | 31.5s |
| #29 | GPT-5 Mini medium | OpenAI | 5 | 8.1 | $0.237 | 12/22 | 27.6s |
| #28 | Gemini 2.5 Flash medium | 6 | 8.2 | $0.643 | 15/22 | 21.2s | |
| #27 | Muse Spark 1.1 low | Meta | 6 | 8.3 | $0.647 | 13/22 | 11.5s |
| #26 | Claude Sonnet 5 medium | Anthropic | 4 | 8.3 | $0.922 | 16/22 | 12.5s |
| #25 | Grok 4.5 medium | X AI | 6 | 8.3 | $1.928 | 16/22 | 61.7s |
| #24 | GPT-5.2 medium | OpenAI | 3 | 8.4 | $0.951 | 14/22 | 22.6s |
| #23 | Grok 4.5 low | X AI | 6 | 8.4 | $0.935 | 16/22 | 15.6s |
| #22 | Qwen3.6 Max Preview medium | Qwen | 5 | 8.4 | $1.143 | 16/22 | 67.5s |
| #21 | GPT-5.4 medium | OpenAI | 5 | 8.5 | $1.533 | 15/22 | 23.1s |