AI BENCHY Fouten
Instructies niet gevolgd-fouten
Zie welke AI-modellen het vaakst tegen Instructies niet gevolgd aanlopen, zodat je betrouwbaarheidsrisico's ziet voordat je kiest. Sorteren op: Aantal fouten โ.
| Rang | Model | Bedrijf | Instructies niet gevolgd-aantal | Score | Correcte tests | Responstijd (gem.) |
|---|---|---|---|---|---|---|
| #88 | Nemotron 3 Super none | NVIDIA | 4 | 5.1 | 4/18 | 8.54s |
| #44 | GPT-5.4 Mini medium | OpenAI | 5 | 7.3 | 9/18 | 15.2s |
| #84 | gpt-oss-120b none | OpenAI | 5 | 5.2 | 4/18 | 12.0s |
| #92 | Qwen3 Coder Next medium | Qwen | 5 | 4.7 | 3/18 | 10.8s |
| #80 | MiniMax M2.7 medium | Minimax | 6 | 5.3 | 4/18 | 31.1s |