Instructies niet gevolgd-fouten
Zie welke AI-modellen het vaakst tegen Instructies niet gevolgd aanlopen, zodat je betrouwbaarheidsrisico's ziet voordat je kiest. Sorteren op: Responstijd (gem.) โ.
Getoonde modellen
15
Totaal fouten
246
Meest getroffen model
Nemotron 3 Nano Omni 30b A3b Reasoning 2
141/141
Modellen filteren
Geen modellen komen overeen met de huidige zoekopdracht en filters.
| Rang | Model | Bedrijf | Instructies niet gevolgd-aantal | Score | Totale kosten | Correcte tests | Responstijd (gem.) |
|---|---|---|---|---|---|---|---|
| #106 | Hy3 preview medium | Tencent | 1 | 6.5 | $0.018 | 14/21 | 16.3s |
| #110 | Gemini 3.1 Flash Lite Preview low | 1 | 6.5 | $0.646 | 13/22 | 16.7s | |
| #16 | GPT-5.3-Codex medium | OpenAI | 2 | 8.9 | $0.920 | 16/22 | 17.0s |
| #213 | Nemotron 3 Nano Omni 30b A3b Reasoning medium | NVIDIA | 1 | 3.4 | $0.000 | 4/19 | 17.1s |
| #179 | DeepSeek V3.2 none | DeepSeek | 1 | 5.0 | $0.054 | 6/22 | 18.3s |
| #175 | Qwen3.5-9B none | Qwen | 2 | 5.1 | $0.021 | 4/22 | 19.2s |
| #144 | Kimi K2.6 none | Moonshot AI | 3 | 5.8 | $0.184 | 7/22 | 19.6s |
| #119 | MiMo-V2-Flash medium | Xiaomi | 1 | 6.3 | $0.043 | 12/21 | 20.1s |
| #28 | Gemini 2.5 Flash medium | 1 | 8.2 | $0.643 | 15/22 | 21.2s | |
| #212 | gpt-oss-120b none | OpenAI | 2 | 3.7 | $0.010 | 6/19 | 21.6s |
| #127 | gpt-oss-120b medium | OpenAI | 3 | 6.1 | $0.019 | 9/22 | 21.9s |
| #115 | Mimo V2 PRO medium | Xiaomi | 1 | 6.3 | $0.333 | 12/21 | 22.2s |
| #24 | GPT-5.2 medium | OpenAI | 3 | 8.4 | $0.951 | 14/22 | 22.6s |
| #53 | GLM 5 Turbo medium | Z.ai | 1 | 7.6 | $0.323 | 14/21 | 23.0s |
| #98 | GLM 5V Turbo medium | Z.ai | 1 | 6.7 | $0.457 | 11/21 | 23.1s |