Anweisungen nicht befolgt-Fehler
Sieh, bei welchen KI-Modellen Anweisungen nicht befolgt besonders häufig auftritt, damit du Zuverlässigkeitsrisiken vor der Auswahl erkennst. Sortieren nach: Antwortzeit (Durchschnitt) ↑.
Angezeigte Modelle
15
Gesamtfehler
246
Am stärksten betroffenes Modell
Nemotron 3 Nano Omni 30b A3b Reasoning 2
141/141
Modelle filtern
Keine Modelle entsprechen der aktuellen Suche und den Filtern.
| Rang | Modell | Unternehmen | Anweisungen nicht befolgt-Anzahl | Punktzahl | Gesamtkosten | Korrekte Tests | Antwortzeit (Durchschnitt) |
|---|---|---|---|---|---|---|---|
| #156 | DeepSeek V4 Flash none | DeepSeek | 1 | 5.6 | $0.042 | 5/22 | 36.8s |
| #215 | Step 3.5 Flash none | Stepfun | 1 | 2.3 | $0.020 | 6/12 | 39.0s |
| #194 | Cobuddy medium | Baidu | 3 | 4.7 | $0.000 | 7/21 | 39.9s |
| #140 | Mimo V2 Omni medium | Xiaomi | 2 | 5.9 | $0.683 | 10/21 | 41.2s |
| #178 | MiniMax M2.7 medium | Minimax | 5 | 5.0 | $0.163 | 5/22 | 41.3s |
| #41 | Qwen3.6 Plus medium | Qwen | 1 | 7.8 | $0.405 | 15/22 | 43.1s |
| #89 | Qwen3.6 Flash medium | Qwen | 1 | 6.9 | $0.738 | 12/22 | 44.7s |
| #77 | Grok 4.3 medium | X AI | 2 | 7.1 | $0.779 | 13/22 | 47.4s |
| #39 | Seed-2.0-Lite medium | Bytedance Seed | 2 | 7.9 | $0.234 | 14/22 | 48.5s |
| #49 | DeepSeek V4 Flash high | DeepSeek | 2 | 7.7 | $0.041 | 13/22 | 49.7s |
| #146 | Nemotron 3 Super medium | NVIDIA | 3 | 5.7 | $0.055 | 8/22 | 52.0s |
| #134 | GPT-5 Nano medium | OpenAI | 2 | 6.1 | $0.114 | 9/22 | 54.9s |
| #185 | Ring-2.6-1T none | Inclusionai | 2 | 4.8 | $0.026 | 9/22 | 55.1s |
| #94 | Qwen3.6 35B A3B medium | Qwen | 1 | 6.7 | $0.746 | 13/22 | 58.1s |
| #149 | Gemini 3.1 Flash Lite high | 3 | 5.6 | $2.044 | 10/18 | 62.0s |