Anweisungen nicht befolgt-Fehler
Sieh, bei welchen KI-Modellen Anweisungen nicht befolgt besonders häufig auftritt, damit du Zuverlässigkeitsrisiken vor der Auswahl erkennst. Sortieren nach: Korrekte Tests ↓.
141/141
Modelle filtern
Keine Modelle entsprechen der aktuellen Suche und den Filtern.
| Rang | Modell | Unternehmen | Anweisungen nicht befolgt-Anzahl | Punktzahl | Gesamtkosten | Korrekte Tests | Antwortzeit (Durchschnitt) |
|---|---|---|---|---|---|---|---|
| #191 | Grok 4.1 Fast medium | X AI | 4 | 4.7 | $0.069 | 9/19 | 23.8s |
| #192 | Laguna M.1 medium | Poolside | 1 | 4.7 | $0.033 | 9/19 | 14.7s |
| #50 | DeepSeek V4 Pro high | DeepSeek | 2 | 7.7 | $0.200 | 10/22 | 79.1s |
| #81 | Kimi K2.5 medium | Moonshot AI | 2 | 7.0 | $0.600 | 10/22 | 99.0s |
| #82 | Mercury 2 medium | Inception | 3 | 7.0 | $0.093 | 10/22 | 2.72s |
| #86 | DeepSeek V4 Pro none | DeepSeek | 2 | 6.9 | $0.096 | 10/22 | 11.6s |
| #96 | LongCat 2.0 low | Meituan | 1 | 6.7 | $0.391 | 10/22 | 100.3s |
| #105 | Qwen3.6 27B medium | Qwen | 1 | 6.5 | $0.779 | 10/22 | 106.3s |
| #121 | Gemma 4 31B none | 1 | 6.2 | $0.021 | 10/22 | 5.34s | |
| #123 | GPT-5.6 Luna low | OpenAI | 1 | 6.2 | $0.249 | 10/22 | 5.04s |
| #126 | Gemini 3.1 Flash Lite minimal | 3 | 6.1 | $0.047 | 10/22 | 1.86s | |
| #129 | Inkling low | Thinkingmachines | 2 | 6.1 | $0.187 | 10/22 | 5.15s |
| #187 | Grok 4.20 Multi Agent Beta medium | X AI | 2 | 4.8 | $5.599 | 8/18 | 9.69s |
| #190 | Hunter Alpha medium | OpenRouter | 2 | 4.7 | $0.000 | 8/18 | 10.3s |
| #102 | LongCat 2.0 high | Meituan | 2 | 6.6 | $0.469 | 9/22 | 148.7s |