Befolgung von Anweisungen: Anweisungen nicht befolgt
Befolgung von Anweisungen
Anweisungen nicht befolgt
Sieh, welche KI-Modelle bei Befolgung von Anweisungen am ehesten auf Anweisungen nicht befolgt stoßen, damit du Schwachstellen schneller erkennst.
Fehlergründe
18/18
Modelle filtern
Keine Modelle entsprechen der aktuellen Suche und den Filtern.
| Rang | Modell | Unternehmen | Anweisungen nicht befolgt-Anzahl | Kategorie-Score | Gesamtkosten | Korrekte Tests | Antwortzeit (Durchschnitt) |
|---|---|---|---|---|---|---|---|
| #16 | Muse Spark 1.1 medium | Meta | 1 | 6.5 | $1.357 | 1/2 | 6.31s |
| #24 | Muse Spark 1.1 low | Meta | 1 | 7.3 | $0.647 | 1/2 | 5.42s |
| #27 | Muse Spark 1.1 high | Meta | 1 | 6.4 | $1.694 | 1/2 | 7.81s |
| #46 | DeepSeek V4 Pro high | DeepSeek | 1 | 7.8 | $0.200 | 1/2 | 8.73s |
| #83 | GPT-5.6 Sol none | OpenAI | 1 | 8.5 | $0.524 | 1/2 | 1.33s |
| #117 | GPT-5.6 Luna low | OpenAI | 1 | 8.5 | $0.249 | 1/2 | 2.04s |
| #130 | Step 3.5 Flash medium | Stepfun | 1 | 8.3 | $0.108 | 1/2 | 4.78s |
| #132 | GPT-5.6 Terra none | OpenAI | 1 | 8.5 | $0.349 | 1/2 | 1.15s |
| #134 | Mimo V2 Omni medium | Xiaomi | 1 | 8.3 | $0.683 | 1/2 | 4.99s |
| #140 | Nemotron 3 Super medium | NVIDIA | 1 | 7.3 | $0.050 | 1/2 | 6.97s |
| #172 | MiniMax M2.7 medium | Minimax | 1 | 3.8 | $0.163 | 0/2 | 12.8s |
| #183 | Trinity Large Preview none | Arcee AI | 1 | 3.5 | $0.008 | 0/2 | 822ms |
| #185 | Grok 4.1 Fast medium | X AI | 1 | 6.5 | $0.069 | 1/2 | 4.63s |
| #190 | MiniMax M2.5 medium | Minimax | 1 | 7.5 | $0.340 | 1/2 | 621ms |
| #201 | Granite 4.1 8B none | IBM Granite | 1 | 3.6 | $0.007 | 0/2 | 344ms |