Anweisungen nicht befolgt-Fehler
Sieh, bei welchen KI-Modellen Anweisungen nicht befolgt besonders häufig auftritt, damit du Zuverlässigkeitsrisiken vor der Auswahl erkennst. Sortieren nach: Fehleranzahl ↑.
141/141
Modelle filtern
Keine Modelle entsprechen der aktuellen Suche und den Filtern.
| Rang | Modell | Unternehmen | Anweisungen nicht befolgt-Anzahl | Punktzahl | Gesamtkosten | Korrekte Tests | Antwortzeit (Durchschnitt) |
|---|---|---|---|---|---|---|---|
| #58 | GPT-5.3 Chat none | OpenAI | 2 | 7.5 | $0.571 | 13/22 | 6.88s |
| #62 | Qwen3.5-27B medium | Qwen | 2 | 7.4 | $1.627 | 13/22 | 111.9s |
| #72 | Kimi K2.6 medium | Moonshot AI | 2 | 7.2 | $1.036 | 12/22 | 110.0s |
| #77 | Grok 4.3 medium | X AI | 2 | 7.1 | $0.779 | 13/22 | 47.4s |
| #79 | Grok 4.20 medium | X AI | 2 | 7.1 | $0.777 | 12/22 | 29.5s |
| #81 | Kimi K2.5 medium | Moonshot AI | 2 | 7.0 | $0.600 | 10/22 | 99.0s |
| #86 | DeepSeek V4 Pro none | DeepSeek | 2 | 6.9 | $0.096 | 10/22 | 11.6s |
| #88 | MiMo-V2.5-Pro medium | Xiaomi | 2 | 6.9 | $0.187 | 12/22 | 33.9s |
| #102 | LongCat 2.0 high | Meituan | 2 | 6.6 | $0.469 | 9/22 | 148.7s |
| #109 | Qwen3.5-27B none | Qwen | 2 | 6.5 | $0.090 | 8/22 | 4.76s |
| #112 | Gemini 3.1 Flash Lite Preview none | 2 | 6.4 | $0.052 | 12/22 | 1.58s | |
| #114 | Ring-2.6-1T medium | Inclusionai | 2 | 6.3 | $0.103 | 11/22 | 68.7s |
| #129 | Inkling low | Thinkingmachines | 2 | 6.1 | $0.187 | 10/22 | 5.15s |
| #132 | Qwen3.5 Plus 2026-04-20 none | Qwen | 2 | 6.1 | $0.122 | 8/22 | 13.6s |
| #133 | Qwen3.5-35B-A3B none | Qwen | 2 | 6.1 | $0.106 | 7/22 | 12.7s |