Befolgung von Anweisungen: Falsche Antwort
Befolgung von Anweisungen
Falsche Antwort
Sieh, welche KI-Modelle bei Befolgung von Anweisungen am ehesten auf Falsche Antwort stoßen, damit du Schwachstellen schneller erkennst. Sortieren nach: Antwortzeit (Durchschnitt) ↓.
Fehlergründe
65/65
Modelle filtern
Keine Modelle entsprechen der aktuellen Suche und den Filtern.
| Rang | Modell | Unternehmen | Falsche Antwort-Anzahl | Kategorie-Score | Gesamtkosten | Korrekte Tests | Antwortzeit (Durchschnitt) |
|---|---|---|---|---|---|---|---|
| #179 | North Mini Code none | Cohere | 1 | 6.5 | $0.000 | 1/2 | 30.7s |
| #180 | MiniMax M2.7 medium | Minimax | 1 | 3.8 | $0.163 | 0/2 | 12.8s |
| #152 | Owl Alpha medium | Openrouter | 1 | 6.5 | $0.000 | 1/2 | 10.2s |
| #131 | Qwen3.5-Flash none | Qwen | 1 | 6.3 | $0.073 | 1/2 | 8.81s |
| #174 | Qwen3 Coder Next none | Qwen | 1 | 6.3 | $0.025 | 1/2 | 7.78s |
| #196 | Qwen3 Coder Next medium | Qwen | 1 | 6.3 | $0.032 | 1/2 | 7.49s |
| #78 | GLM 5.1 medium | Z.ai | 1 | 6.4 | $0.535 | 1/2 | 7.47s |
| #64 | LongCat 2.0 medium | Meituan | 1 | 6.5 | $0.478 | 1/2 | 7.38s |
| #102 | LongCat 2.0 high | Meituan | 1 | 6.5 | $0.469 | 1/2 | 6.96s |
| #96 | LongCat 2.0 low | Meituan | 1 | 6.5 | $0.391 | 1/2 | 6.39s |
| #170 | Ling-2.6-1T none | Inclusionai | 1 | 6.4 | $0.016 | 1/2 | 5.36s |
| #163 | Mimo V2 Omni none | Xiaomi | 1 | 6.5 | $0.021 | 1/2 | 4.26s |
| #86 | DeepSeek V4 Pro none | DeepSeek | 1 | 6.3 | $0.096 | 1/2 | 4.12s |
| #204 | GLM 4.7 Flash medium | Z.ai | 1 | 6.2 | $0.166 | 1/2 | 2.97s |
| #121 | Gemma 4 31B none | 1 | 6.5 | $0.021 | 1/2 | 2.84s |