Anweisungen nicht befolgt-Fehler
Sieh, bei welchen KI-Modellen Anweisungen nicht befolgt besonders häufig auftritt, damit du Zuverlässigkeitsrisiken vor der Auswahl erkennst.
Kategorien
In der Kategorie Rätsellösen128 In der Kategorie Allgemeine Intelligenz115 In der Kategorie Befolgung von Anweisungen48 In der Kategorie Anti-KI-Tricks44 In der Kategorie Programmierung29 In der Kategorie Werkzeugaufrufe12 In der Kategorie Datenanalyse und -extraktion7 In der Kategorie Domänenspezifisch2 In der Kategorie Kombiniert1
215/215
Modelle filtern
Keine Modelle entsprechen der aktuellen Suche und den Filtern.
| Rang | Modell | Unternehmen | Anweisungen nicht befolgt-Anzahl | Punktzahl | Gesamtkosten | Korrekte Tests | Antwortzeit (Durchschnitt) |
|---|---|---|---|---|---|---|---|
| #170 | Qwen3.6 27B medium | Qwen | 1 | 6.5 | $0.577 | 10/22 | 106.1s |
| #172 | Hy3 preview medium | Tencent | 1 | 6.5 | $0.049 | 14/21 | 16.3s |
| #176 | Dots 3 Note Preview high | Dots Studio | 1 | 6.4 | $0.000 | 10/22 | 67.8s |
| #178 | MiMo-V2.5 medium | Xiaomi | 1 | 6.4 | $0.104 | 11/22 | 46.3s |
| #181 | Mimo V2 PRO medium | Xiaomi | 1 | 6.3 | $0.333 | 12/21 | 22.2s |
| #182 | MiMo-V2-Flash medium | Xiaomi | 1 | 6.3 | $0.043 | 12/21 | 20.1s |
| #185 | GPT-5.6 Luna low | OpenAI | 1 | 6.2 | $0.051 | 10/22 | 5.20s |
| #186 | Claude Sonnet 5 none | Anthropic | 1 | 6.1 | $0.548 | 7/22 | 6.05s |
| #190 | Qwen3.7 Flash none | Qwen | 1 | 6.1 | $0.019 | 7/22 | 10.1s |
| #191 | Gemini 3.1 Flash Lite none | 1 | 6.1 | $0.046 | 9/22 | 1.75s | |
| #192 | Qwen3.5-Flash medium | Qwen | 1 | 6.1 | $0.142 | 11/22 | 84.4s |
| #195 | Qwen3.6 Flash none | Qwen | 1 | 6.1 | $0.062 | 7/22 | 3.73s |
| #196 | Gemma 4 31B none | 1 | 6.1 | $0.016 | 9/22 | 5.41s | |
| #198 | Nemotron 3 Ultra none | NVIDIA | 1 | 6.1 | $0.093 | 8/22 | 3.88s |
| #201 | Grok 4.20 Beta medium | X AI | 1 | 6.0 | $0.750 | 14/18 | 9.75s |