AI BENCHY Fouten
Verkeerd antwoord-fouten
Zie welke AI-modellen het vaakst tegen Verkeerd antwoord aanlopen, zodat je betrouwbaarheidsrisico's ziet voordat je kiest. Sorteren op: Correcte tests โ.
Categorieรซn
In categorie Domeinspecifiek314 In categorie Anti-AI-trucs245 In categorie Programmeren194 In categorie Puzzeloplossing147 In categorie Algemene kennis130 In categorie Instructies opvolgen53 In categorie Gecombineerd52 In categorie Gegevensparsering en extractie35 In categorie Algemene intelligentie32 In categorie Toolaanroepen2
| Rang | Model | Bedrijf | Verkeerd antwoord-aantal | Score | Correcte tests | Responstijd (gem.) |
|---|---|---|---|---|---|---|
| #108 | Qwen3.5-Flash none | Qwen | 13 | 5.8 | 8/21 | 3.58s |
| #109 | GLM 5V Turbo none | Z.ai | 11 | 5.8 | 8/21 | 2.99s |
| #110 | Seed-2.0-Lite none | Bytedance Seed | 13 | 5.8 | 8/21 | 2.49s |
| #111 | Owl Alpha medium | Openrouter | 10 | 5.7 | 8/21 | 11.9s |
| #90 | Gemini 3.1 Flash Lite none | 11 | 6.4 | 9/21 | 1.06s | |
| #94 | GPT-5 Nano medium | OpenAI | 9 | 6.3 | 9/21 | 42.5s |
| #95 | Qwen3.5 Plus 2026-02-15 none | Qwen | 12 | 6.3 | 9/21 | 2.31s |
| #96 | Ring-2.6-1T none | Inclusionai | 5 | 6.2 | 9/21 | 55.1s |
| #97 | Gemini 2.5 Flash none | 12 | 6.2 | 9/21 | 875ms | |
| #98 | GLM 5 none | Z.ai | 12 | 6.1 | 9/21 | 4.03s |
| #99 | gpt-oss-120b medium | OpenAI | 9 | 6.1 | 9/21 | 22.3s |
| #79 | Hunter Alpha medium | OpenRouter | 4 | 6.7 | 8/18 | 10.3s |
| #84 | Grok 4.20 Multi Agent Beta medium | X AI | 4 | 6.6 | 8/18 | 9.69s |
| #86 | Grok 4.1 Fast medium | X AI | 4 | 6.5 | 9/19 | 23.8s |
| #92 | Laguna M.1 medium | Poolside | 4 | 6.4 | 9/19 | 14.7s |