Anweisungen nicht befolgt-Fehler
Sieh, bei welchen KI-Modellen Anweisungen nicht befolgt besonders häufig auftritt, damit du Zuverlässigkeitsrisiken vor der Auswahl erkennst. Sortieren nach: Punktzahl ↑.
Kategorien
In der Kategorie Rätsellösen128 In der Kategorie Allgemeine Intelligenz115 In der Kategorie Befolgung von Anweisungen48 In der Kategorie Anti-KI-Tricks44 In der Kategorie Programmierung29 In der Kategorie Werkzeugaufrufe12 In der Kategorie Datenanalyse und -extraktion7 In der Kategorie Domänenspezifisch2 In der Kategorie Kombiniert1
215/215
Modelle filtern
Keine Modelle entsprechen der aktuellen Suche und den Filtern.
| Rang | Modell | Unternehmen | Anweisungen nicht befolgt-Anzahl | Punktzahl | Gesamtkosten | Korrekte Tests | Antwortzeit (Durchschnitt) |
|---|---|---|---|---|---|---|---|
| #170 | Qwen3.6 27B medium | Qwen | 1 | 6.5 | $0.577 | 10/22 | 106.1s |
| #168 | Mercury 2.5 Preview high | Inception | 2 | 6.6 | $0.030 | 12/22 | 4.01s |
| #167 | Qwen3.6 35B A3B medium | Qwen | 1 | 6.6 | $0.672 | 12/22 | 58.5s |
| #165 | Inkling Small medium | Thinkingmachines | 4 | 6.6 | $0.113 | 10/22 | 6.30s |
| #164 | Gemini 3.1 Flash Lite Preview low | 1 | 6.6 | $0.646 | 14/22 | 16.7s | |
| #163 | Qwen3.5-27B none | Qwen | 2 | 6.6 | $0.058 | 9/22 | 4.77s |
| #162 | Gemini 3.5 Flash Lite low | 1 | 6.6 | $0.138 | 12/22 | 2.56s | |
| #160 | LongCat 2.0 high | Meituan | 2 | 6.7 | $0.492 | 9/22 | 153.3s |
| #159 | GLM 5V Turbo medium | Z.ai | 1 | 6.7 | $0.457 | 11/21 | 23.1s |
| #158 | Gemini 3.5 Flash minimal | 1 | 6.7 | $0.300 | 13/22 | 2.65s | |
| #157 | LongCat 2.0 low | Meituan | 1 | 6.7 | $0.412 | 10/22 | 113.6s |
| #155 | GLM 5.2 none | Z.ai | 1 | 6.7 | $0.153 | 13/22 | 9.65s |
| #152 | MiMo-V2.5-Pro medium | Xiaomi | 2 | 6.8 | $0.221 | 11/22 | 48.7s |
| #151 | GLM 5.3 low | Z.ai | 1 | 6.8 | $0.257 | 12/22 | 13.6s |
| #150 | DeepSeek V4 Pro none | DeepSeek | 2 | 6.8 | $0.220 | 9/22 | 11.7s |