Anweisungen nicht befolgt-Fehler
Sieh, bei welchen KI-Modellen Anweisungen nicht befolgt besonders häufig auftritt, damit du Zuverlässigkeitsrisiken vor der Auswahl erkennst. Sortieren nach: Korrekte Tests ↓.
Kategorien
In der Kategorie Rätsellösen128 In der Kategorie Allgemeine Intelligenz115 In der Kategorie Befolgung von Anweisungen48 In der Kategorie Anti-KI-Tricks44 In der Kategorie Programmierung29 In der Kategorie Werkzeugaufrufe12 In der Kategorie Datenanalyse und -extraktion7 In der Kategorie Domänenspezifisch2 In der Kategorie Kombiniert1
215/215
Modelle filtern
Keine Modelle entsprechen der aktuellen Suche und den Filtern.
| Rang | Modell | Unternehmen | Anweisungen nicht befolgt-Anzahl | Punktzahl | Gesamtkosten | Korrekte Tests | Antwortzeit (Durchschnitt) |
|---|---|---|---|---|---|---|---|
| #165 | Inkling Small medium | Thinkingmachines | 4 | 6.6 | $0.113 | 10/22 | 6.30s |
| #170 | Qwen3.6 27B medium | Qwen | 1 | 6.5 | $0.577 | 10/22 | 106.1s |
| #175 | Dots 3 Note Preview low | Dots Studio | 2 | 6.4 | $0.000 | 10/22 | 61.8s |
| #176 | Dots 3 Note Preview high | Dots Studio | 1 | 6.4 | $0.000 | 10/22 | 67.8s |
| #185 | GPT-5.6 Luna low | OpenAI | 1 | 6.2 | $0.051 | 10/22 | 5.20s |
| #187 | Gemini 3.1 Flash Lite minimal | 3 | 6.1 | $0.047 | 10/22 | 1.85s | |
| #193 | Inkling low | Thinkingmachines | 2 | 6.1 | $0.187 | 10/22 | 5.11s |
| #211 | GLM 5.3 Flash low | Z.ai | 2 | 5.9 | $0.015 | 10/22 | 9.65s |
| #278 | Grok 4.20 Multi Agent Beta medium | X AI | 2 | 4.8 | $5.599 | 8/18 | 9.69s |
| #282 | Hunter Alpha medium | OpenRouter | 2 | 4.7 | $0.000 | 8/18 | 10.3s |
| #150 | DeepSeek V4 Pro none | DeepSeek | 2 | 6.8 | $0.220 | 9/22 | 11.7s |
| #160 | LongCat 2.0 high | Meituan | 2 | 6.7 | $0.492 | 9/22 | 153.3s |
| #163 | Qwen3.5-27B none | Qwen | 2 | 6.6 | $0.058 | 9/22 | 4.77s |
| #189 | gpt-oss-120b medium | OpenAI | 3 | 6.1 | $0.020 | 9/22 | 20.8s |
| #191 | Gemini 3.1 Flash Lite none | 1 | 6.1 | $0.046 | 9/22 | 1.75s |