AI BENCHY Fouten
Verkeerd antwoord-fouten
Zie welke AI-modellen het vaakst tegen Verkeerd antwoord aanlopen, zodat je betrouwbaarheidsrisico's ziet voordat je kiest. Sorteren op: Aantal fouten โ.
Categorieรซn
In categorie Domeinspecifiek314 In categorie Anti-AI-trucs245 In categorie Programmeren194 In categorie Puzzeloplossing147 In categorie Algemene kennis130 In categorie Instructies opvolgen53 In categorie Gecombineerd52 In categorie Gegevensparsering en extractie35 In categorie Algemene intelligentie32 In categorie Toolaanroepen2
| Rang | Model | Bedrijf | Verkeerd antwoord-aantal | Score | Correcte tests | Responstijd (gem.) |
|---|---|---|---|---|---|---|
| #1 | Gemini 3 Flash Preview medium | 1 | 9.8 | 20/21 | 18.6s | |
| #2 | Gemini 3.5 Flash high | 1 | 9.6 | 20/21 | 8.84s | |
| #83 | Step 3.5 Flash none | Stepfun | 1 | 6.6 | 6/12 | 39.0s |
| #3 | Gemini 3.5 Flash low | 2 | 9.4 | 19/21 | 3.27s | |
| #4 | Gemini 3.1 Pro Preview medium | 2 | 9.4 | 19/21 | 20.1s | |
| #7 | Gemini 3.5 Flash medium | 2 | 9.0 | 18/21 | 4.94s | |
| #12 | Gemini 3.1 Flash Lite Preview high | 2 | 8.6 | 13/16 | 68.1s | |
| #27 | Gemma 4 31B medium | 2 | 7.8 | 14/21 | 56.5s | |
| #66 | Qwen3.5-35B-A3B medium | Qwen | 2 | 7.1 | 11/21 | 72.6s |
| #93 | Qwen3.6 Plus Preview medium | Qwen | 2 | 6.3 | 9/19 | 15.2s |
| #161 | Qwen3.5-9B medium | Qwen | 2 | 4.2 | 3/21 | 82.2s |
| #5 | Qwen3.7 Max medium | Qwen | 3 | 9.1 | 18/21 | 16.0s |
| #6 | GPT-5.5 low | OpenAI | 3 | 9.0 | 18/21 | 9.76s |
| #8 | Claude Opus 4.7 none | Anthropic | 3 | 8.9 | 16/19 | 3.02s |
| #10 | Claude Opus 4.8 medium | Anthropic | 3 | 8.7 | 17/21 | 9.66s |