Instructies niet gevolgd-fouten
Zie welke AI-modellen het vaakst tegen Instructies niet gevolgd aanlopen, zodat je betrouwbaarheidsrisico's ziet voordat je kiest. Sorteren op: Score ↑.
Categorieën
215/215
Modellen filteren
Geen modellen komen overeen met de huidige zoekopdracht en filters.
| Rang | Model | Bedrijf | Instructies niet gevolgd-aantal | Score | Totale kosten | Correcte tests | Responstijd (gem.) |
|---|---|---|---|---|---|---|---|
| #165 | Qwen3.6 27B medium | Qwen | 1 | 6.5 | $1.045 | 10/22 | 106.1s |
| #163 | Mercury 2.5 Preview high | Inception | 2 | 6.6 | $0.030 | 12/22 | 4.01s |
| #162 | Qwen3.6 35B A3B medium | Qwen | 1 | 6.6 | $0.672 | 12/22 | 58.5s |
| #160 | Inkling Small medium | Thinkingmachines | 4 | 6.6 | $0.113 | 10/22 | 6.30s |
| #159 | Gemini 3.1 Flash Lite Preview low | 1 | 6.6 | $0.646 | 14/22 | 16.7s | |
| #158 | Qwen3.5-27B none | Qwen | 2 | 6.6 | $0.058 | 9/22 | 4.77s |
| #157 | Gemini 3.5 Flash Lite low | 1 | 6.6 | $0.138 | 12/22 | 2.56s | |
| #155 | LongCat 2.0 high | Meituan | 2 | 6.7 | $0.492 | 9/22 | 153.3s |
| #154 | GLM 5V Turbo medium | Z.ai | 1 | 6.7 | $0.457 | 11/21 | 23.1s |
| #153 | Gemini 3.5 Flash minimal | 1 | 6.7 | $0.300 | 13/22 | 2.65s | |
| #152 | LongCat 2.0 low | Meituan | 1 | 6.7 | $0.412 | 10/22 | 113.6s |
| #150 | GLM 5.2 none | Z.ai | 1 | 6.7 | $0.153 | 13/22 | 9.65s |
| #147 | MiMo-V2.5-Pro medium | Xiaomi | 2 | 6.8 | $0.221 | 11/22 | 48.7s |
| #146 | GLM 5.3 low | Z.ai | 1 | 6.8 | $0.257 | 12/22 | 13.6s |
| #145 | DeepSeek V4 Pro none | DeepSeek | 2 | 6.8 | $0.226 | 9/22 | 11.7s |