AI BENCHY Fouten
Verkeerd antwoord-fouten
Zie welke AI-modellen het vaakst tegen Verkeerd antwoord aanlopen, zodat je betrouwbaarheidsrisico's ziet voordat je kiest. Sorteren op: Aantal fouten โ.
Categorieรซn
In categorie Domeinspecifiek314 In categorie Anti-AI-trucs245 In categorie Programmeren194 In categorie Puzzeloplossing147 In categorie Algemene kennis130 In categorie Instructies opvolgen53 In categorie Gecombineerd52 In categorie Gegevensparsering en extractie35 In categorie Algemene intelligentie32 In categorie Toolaanroepen2
| Rang | Model | Bedrijf | Verkeerd antwoord-aantal | Score | Correcte tests | Responstijd (gem.) |
|---|---|---|---|---|---|---|
| #119 | Cobuddy medium | Baidu | 9 | 5.6 | 7/21 | 39.9s |
| #136 | Elephant Alpha medium | Openrouter | 9 | 5.1 | 6/21 | 1.27s |
| #137 | Elephant Alpha none | Openrouter | 9 | 5.1 | 5/21 | 1.22s |
| #138 | Ling-2.6-flash none | Inclusionai | 9 | 5.0 | 6/21 | 9.34s |
| #158 | GLM 4.7 Flash medium | Z.ai | 9 | 4.4 | 4/21 | 35.1s |
| #160 | LFM2-24B-A2B none | Liquid | 9 | 4.2 | 2/16 | 782ms |
| #162 | Nemotron 3 Nano Omni 30b A3b Reasoning none | NVIDIA | 9 | 4.1 | 2/19 | 728ms |
| #74 | Qwen3.6 Max Preview none | Qwen | 10 | 6.9 | 11/21 | 3.30s |
| #88 | Qwen3.7 Plus none | Qwen | 10 | 6.4 | 10/21 | 2.85s |
| #101 | Mimo V2 Omni none | Xiaomi | 10 | 6.0 | 8/21 | 2.44s |
| #102 | Gemma 4 26B A4B none | 10 | 6.0 | 8/21 | 5.91s | |
| #106 | Grok 4.20 Beta none | X AI | 10 | 5.8 | 6/18 | 1.19s |
| #111 | Owl Alpha medium | Openrouter | 10 | 5.7 | 8/21 | 11.9s |
| #113 | DeepSeek V4 Pro none | DeepSeek | 10 | 5.7 | 7/21 | 12.4s |
| #121 | Owl Alpha none | Openrouter | 10 | 5.5 | 7/21 | 9.88s |