Rätsellösen: Anweisungen nicht befolgt
Rätsellösen
Anweisungen nicht befolgt
Sieh, welche KI-Modelle bei Rätsellösen am ehesten auf Anweisungen nicht befolgt stoßen, damit du Schwachstellen schneller erkennst. Sortieren nach: Korrekte Tests ↓.
Fehlergründe
121/121
Modelle filtern
Keine Modelle entsprechen der aktuellen Suche und den Filtern.
| Rang | Modell | Unternehmen | Anweisungen nicht befolgt-Anzahl | Kategorie-Score | Gesamtkosten | Korrekte Tests | Antwortzeit (Durchschnitt) |
|---|---|---|---|---|---|---|---|
| #25 | GPT-5.3-Codex medium | OpenAI | 1 | 9.0 | $0.988 | 2/3 | 5.05s |
| #26 | Muse Spark 1.3 high | Meta | 1 | 8.7 | $1.653 | 2/3 | 38.4s |
| #34 | GLM 5.3 Flash max | Z.ai | 1 | 8.7 | $0.059 | 2/3 | 5.61s |
| #36 | Muse Spark 1.2 high | Meta | 1 | 8.2 | $1.771 | 2/3 | 10.1s |
| #37 | Muse Spark 1.2 medium | Meta | 1 | 8.7 | $1.339 | 2/3 | 9.45s |
| #38 | Muse Spark 1.1 medium | Meta | 1 | 7.9 | $1.420 | 2/3 | 42.5s |
| #42 | GPT-5.4 medium | OpenAI | 1 | 8.2 | $1.560 | 2/3 | 9.14s |
| #44 | Muse Spark 1.2 low | Meta | 1 | 8.7 | $0.655 | 2/3 | 5.17s |
| #45 | Grok 4.6 medium | X AI | 1 | 8.7 | $1.713 | 2/3 | 16.3s |
| #47 | GPT-5.2 medium | OpenAI | 1 | 7.5 | $1.182 | 2/3 | 5.80s |
| #51 | Muse Spark 1.1 low | Meta | 1 | 8.3 | $0.673 | 2/3 | 6.60s |
| #54 | Muse Spark 1.3 low | Meta | 1 | 8.2 | $0.689 | 2/3 | 11.3s |
| #61 | DeepSeek V4 Flash 0731 low | DeepSeek | 1 | 8.0 | $0.044 | 2/3 | 9.08s |
| #62 | DeepSeek V4 Flash 0731 high | DeepSeek | 1 | 8.2 | $0.084 | 2/3 | 9.36s |
| #76 | Qwen3.8 27B medium | Qwen | 1 | 8.3 | ~$0.058 | 2/3 | 12.6s |