Anweisungen nicht befolgt-Fehler
Sieh, bei welchen KI-Modellen Anweisungen nicht befolgt besonders häufig auftritt, damit du Zuverlässigkeitsrisiken vor der Auswahl erkennst. Sortieren nach: Antwortzeit (Durchschnitt) ↑.
Angezeigte Modelle
5
Gesamtfehler
245
Am stärksten betroffenes Modell
Nemotron 3 Nano Omni 30b A3b Reasoning 2
140/140
Modelle filtern
Keine Modelle entsprechen der aktuellen Suche und den Filtern.
| Rang | Modell | Unternehmen | Anweisungen nicht befolgt-Anzahl | Punktzahl | Gesamtkosten | Korrekte Tests | Antwortzeit (Durchschnitt) |
|---|---|---|---|---|---|---|---|
| #68 | Kimi K2.6 medium | Moonshot AI | 2 | 7.2 | $1.036 | 12/22 | 110.0s |
| #58 | Qwen3.5-27B medium | Qwen | 2 | 7.4 | $1.627 | 13/22 | 111.9s |
| #194 | GLM 4.7 Flash medium | Z.ai | 2 | 4.3 | $0.166 | 4/22 | 142.6s |
| #97 | LongCat 2.0 high | Meituan | 2 | 6.6 | $0.469 | 9/22 | 148.7s |
| #130 | Step 3.5 Flash medium | Stepfun | 3 | 6.0 | $0.108 | 11/21 | 174.2s |