Verkeerd antwoord-fouten
Zie welke AI-modellen het vaakst tegen Verkeerd antwoord aanlopen, zodat je betrouwbaarheidsrisico's ziet voordat je kiest. Sorteren op: Responstijd (gem.) โ.
Categorieรซn
In categorie Domeinspecifiek412 In categorie Anti-AI-trucs293 In categorie Programmeren252 In categorie Puzzeloplossing201 In categorie Algemene kennis168 In categorie Gecombineerd68 In categorie Instructies opvolgen61 In categorie Algemene intelligentie59 In categorie Gegevensparsering en extractie41 In categorie Toolaanroepen3
209/209
Modellen filteren
Geen modellen komen overeen met de huidige zoekopdracht en filters.
| Rang | Model | Bedrijf | Verkeerd antwoord-aantal | Score | Totale kosten | Correcte tests | Responstijd (gem.) |
|---|---|---|---|---|---|---|---|
| #52 | Kimi K2.7 Code medium | Moonshot AI | 5 | 7.5 | $0.751 | 12/22 | 84.2s |
| #204 | Qwen3.5-9B medium | Qwen | 2 | 3.8 | $0.036 | 3/22 | 82.2s |
| #46 | DeepSeek V4 Pro high | DeepSeek | 6 | 7.7 | $0.200 | 10/22 | 79.1s |
| #12 | Grok 4.5 high | X AI | 2 | 8.9 | $1.707 | 17/22 | 76.5s |
| #110 | Gemma 4 31B medium | 2 | 6.3 | $0.163 | 14/22 | 75.4s | |
| #47 | MiniMax M3 medium | Minimax | 3 | 7.6 | $0.286 | 12/22 | 75.0s |
| #108 | Ring-2.6-1T medium | Inclusionai | 6 | 6.3 | $0.103 | 11/22 | 68.7s |
| #76 | DeepSeek V3.2 medium | DeepSeek | 5 | 7.0 | $0.078 | 11/22 | 68.6s |
| #190 | MiniMax M2.5 medium | Minimax | 7 | 4.6 | $0.340 | 5/22 | 68.3s |
| #163 | Gemini 3.1 Flash Lite Preview high | 2 | 5.3 | $2.310 | 13/16 | 68.1s | |
| #19 | Qwen3.6 Max Preview medium | Qwen | 5 | 8.4 | $1.143 | 16/22 | 67.5s |
| #86 | Step 3.7 Flash high | Stepfun | 6 | 6.9 | $1.207 | 11/22 | 64.7s |
| #72 | Qwen3.5-122B-A10B medium | Qwen | 5 | 7.1 | $1.046 | 14/22 | 64.2s |
| #28 | Inkling high | Thinkingmachines | 4 | 8.0 | $1.006 | 15/22 | 64.2s |
| #31 | GLM 5.2 high | Z.ai | 3 | 8.0 | $0.970 | 14/22 | 62.7s |