Anweisungen nicht befolgt-Fehler
Sieh, bei welchen KI-Modellen Anweisungen nicht befolgt besonders häufig auftritt, damit du Zuverlässigkeitsrisiken vor der Auswahl erkennst. Sortieren nach: Antwortzeit (Durchschnitt) ↑.
Angezeigte Modelle
15
Gesamtfehler
386
Am stärksten betroffenes Modell
Nemotron 3 Nano Omni 30b A3b Reasoning 2Kategorien
In der Kategorie Rätsellösen128 In der Kategorie Allgemeine Intelligenz115 In der Kategorie Befolgung von Anweisungen48 In der Kategorie Anti-KI-Tricks44 In der Kategorie Programmierung29 In der Kategorie Werkzeugaufrufe12 In der Kategorie Datenanalyse und -extraktion7 In der Kategorie Domänenspezifisch2 In der Kategorie Kombiniert1
215/215
Modelle filtern
Keine Modelle entsprechen der aktuellen Suche und den Filtern.
| Rang | Modell | Unternehmen | Anweisungen nicht befolgt-Anzahl | Punktzahl | Gesamtkosten | Korrekte Tests | Antwortzeit (Durchschnitt) |
|---|---|---|---|---|---|---|---|
| #308 | Grok 4.1 Fast none | X AI | 3 | 3.8 | $0.008 | 3/19 | 1.62s |
| #202 | GPT-5.6 Terra none | OpenAI | 1 | 6.0 | $0.280 | 8/22 | 1.66s |
| #191 | Gemini 3.1 Flash Lite none | 1 | 6.1 | $0.046 | 9/22 | 1.75s | |
| #187 | Gemini 3.1 Flash Lite minimal | 3 | 6.1 | $0.047 | 10/22 | 1.85s | |
| #268 | GPT-4o-mini none | OpenAI | 1 | 5.0 | $0.010 | 5/22 | 1.92s |
| #219 | Inkling Small low | Thinkingmachines | 2 | 5.7 | $0.055 | 9/22 | 2.07s |
| #214 | GPT-5.4 none | OpenAI | 1 | 5.8 | $0.397 | 7/22 | 2.08s |
| #132 | GPT-5.6 Sol none | OpenAI | 1 | 7.0 | $0.201 | 12/22 | 2.17s |
| #229 | Mimo V2 PRO none | Xiaomi | 2 | 5.6 | $0.045 | 7/21 | 2.27s |
| #237 | Mimo V2 Omni none | Xiaomi | 1 | 5.5 | $0.021 | 8/21 | 2.44s |
| #162 | Gemini 3.5 Flash Lite low | 1 | 6.6 | $0.138 | 12/22 | 2.56s | |
| #276 | GPT-5.4 Nano none | OpenAI | 2 | 4.8 | $0.041 | 4/22 | 2.56s |
| #158 | Gemini 3.5 Flash minimal | 1 | 6.7 | $0.300 | 13/22 | 2.65s | |
| #301 | MiMo-V2-Flash none | Xiaomi | 2 | 4.0 | $0.025 | 4/21 | 2.76s |
| #262 | GLM 5 Turbo none | Z.ai | 2 | 5.1 | $0.047 | 6/21 | 2.82s |