Verkeerd antwoord-fouten
Zie welke AI-modellen het vaakst tegen Verkeerd antwoord aanlopen, zodat je betrouwbaarheidsrisico's ziet voordat je kiest. Sorteren op: Responstijd (gem.) ↑.
Getoonde modellen
15
Totaal fouten
2265
Meest getroffen model
Nemotron 3 Nano Omni 30b A3b Reasoning 9Categorieën
In categorie Domeinspecifiek659 In categorie Anti-AI-trucs386 In categorie Programmeren361 In categorie Puzzeloplossing275 In categorie Algemene kennis246 In categorie Gecombineerd95 In categorie Algemene intelligentie90 In categorie Instructies opvolgen82 In categorie Gegevensparsering en extractie66 In categorie Toolaanroepen5
313/313
Modellen filteren
Geen modellen komen overeen met de huidige zoekopdracht en filters.
| Rang | Model | Bedrijf | Verkeerd antwoord-aantal | Score | Totale kosten | Correcte tests | Responstijd (gem.) |
|---|---|---|---|---|---|---|---|
| #147 | Seed-2.0-Code medium | Bytedance Seed | 4 | 6.8 | $1.153 | 10/22 | 101.1s |
| #154 | Gemma 4 26B A4B medium | 2 | 6.8 | $0.092 | 15/22 | 104.9s | |
| #170 | Qwen3.6 27B medium | Qwen | 5 | 6.5 | $0.577 | 10/22 | 106.1s |
| #309 | Qwen3.5-9B medium | Qwen | 2 | 3.8 | $0.062 | 3/22 | 107.5s |
| #188 | Qwen3.5-35B-A3B medium | Qwen | 2 | 6.1 | $0.675 | 11/22 | 110.8s |
| #245 | Laguna S 2.1 high | Poolside | 11 | 5.4 | $0.114 | 4/22 | 111.6s |
| #100 | Qwen3.5-27B medium | Qwen | 4 | 7.5 | $0.982 | 13/22 | 113.3s |
| #157 | LongCat 2.0 low | Meituan | 7 | 6.7 | $0.412 | 10/22 | 113.6s |
| #67 | DeepSeek V4 Flash 0731 high | DeepSeek | 4 | 8.0 | $0.084 | 14/22 | 114.9s |
| #121 | Kimi K2.6 medium | Moonshot AI | 3 | 7.2 | $1.247 | 12/22 | 115.9s |
| #61 | Qwen3.8 2.4T A95B low | Qwen | 4 | 8.1 | $2.672 | 15/22 | 119.0s |
| #130 | Solar Pro 4 high | Upstage | 5 | 7.1 | $0.046 | 11/22 | 120.6s |
| #110 | Qwen3.8 2.4T A95B high | Qwen | 3 | 7.4 | $2.357 | 14/22 | 120.6s |
| #143 | Seed-2.0-Code high | Bytedance Seed | 4 | 6.9 | $1.273 | 11/22 | 124.2s |
| #149 | Solar Pro 4 medium | Upstage | 5 | 6.8 | $0.047 | 12/22 | 127.6s |