Anweisungen nicht befolgt-Fehler
Sieh, bei welchen KI-Modellen Anweisungen nicht befolgt besonders häufig auftritt, damit du Zuverlässigkeitsrisiken vor der Auswahl erkennst. Sortieren nach: Fehleranzahl ↑.
Kategorien
In der Kategorie Rätsellösen128 In der Kategorie Allgemeine Intelligenz115 In der Kategorie Befolgung von Anweisungen48 In der Kategorie Anti-KI-Tricks44 In der Kategorie Programmierung29 In der Kategorie Werkzeugaufrufe12 In der Kategorie Datenanalyse und -extraktion7 In der Kategorie Domänenspezifisch2 In der Kategorie Kombiniert1
215/215
Modelle filtern
Keine Modelle entsprechen der aktuellen Suche und den Filtern.
| Rang | Modell | Unternehmen | Anweisungen nicht befolgt-Anzahl | Punktzahl | Gesamtkosten | Korrekte Tests | Antwortzeit (Durchschnitt) |
|---|---|---|---|---|---|---|---|
| #206 | Qwen3.5-35B-A3B none | Qwen | 2 | 5.9 | $0.076 | 6/22 | 12.7s |
| #208 | Dots 3 Note Preview medium | Dots Studio | 2 | 5.9 | $0.000 | 8/22 | 67.1s |
| #209 | Mimo V2 Omni medium | Xiaomi | 2 | 5.9 | $0.683 | 10/21 | 41.2s |
| #211 | GLM 5.3 Flash low | Z.ai | 2 | 5.9 | $0.015 | 10/22 | 9.65s |
| #219 | Inkling Small low | Thinkingmachines | 2 | 5.7 | $0.055 | 9/22 | 2.07s |
| #223 | Qwen3.5-122B-A10B none | Qwen | 2 | 5.7 | $0.283 | 6/22 | 12.9s |
| #226 | GLM 5V Turbo none | Z.ai | 2 | 5.6 | $0.052 | 8/21 | 2.99s |
| #227 | Owl Alpha medium | Openrouter | 2 | 5.6 | $0.000 | 8/21 | 11.9s |
| #228 | Gemma 4 26B A4B none | 2 | 5.6 | $0.015 | 9/22 | 7.58s | |
| #229 | Mimo V2 PRO none | Xiaomi | 2 | 5.6 | $0.045 | 7/21 | 2.27s |
| #234 | Qwen3.6 27B none | Qwen | 2 | 5.5 | $0.062 | 7/22 | 10.6s |
| #240 | KAT-Coder-Air V2.5 low | Kwaipilot | 2 | 5.4 | $0.046 | 7/22 | 10.6s |
| #244 | DeepSeek V4 Flash 0731 none | DeepSeek | 2 | 5.4 | $0.011 | 4/22 | 20.7s |
| #248 | Seed-2.0-Code none | Bytedance Seed | 2 | 5.3 | $0.151 | 6/22 | 14.7s |
| #249 | Ling-2.6-1T none | Inclusionai | 2 | 5.3 | $0.016 | 4/22 | 8.59s |