Anweisungen nicht befolgt-Fehler
Sieh, bei welchen KI-Modellen Anweisungen nicht befolgt besonders häufig auftritt, damit du Zuverlässigkeitsrisiken vor der Auswahl erkennst. Sortieren nach: Fehleranzahl ↑.
141/141
Modelle filtern
Keine Modelle entsprechen der aktuellen Suche und den Filtern.
| Rang | Modell | Unternehmen | Anweisungen nicht befolgt-Anzahl | Punktzahl | Gesamtkosten | Korrekte Tests | Antwortzeit (Durchschnitt) |
|---|---|---|---|---|---|---|---|
| #183 | Nemotron 3 Super none | NVIDIA | 2 | 4.9 | $0.008 | 5/22 | 5.97s |
| #184 | Ling-2.6-flash none | Inclusionai | 2 | 4.9 | $0.002 | 6/22 | 10.7s |
| #185 | Ring-2.6-1T none | Inclusionai | 2 | 4.8 | $0.026 | 9/22 | 55.1s |
| #186 | GPT-5.4 Nano none | OpenAI | 2 | 4.8 | $0.041 | 4/22 | 2.57s |
| #187 | Grok 4.20 Multi Agent Beta medium | X AI | 2 | 4.8 | $5.599 | 8/18 | 9.69s |
| #190 | Hunter Alpha medium | OpenRouter | 2 | 4.7 | $0.000 | 8/18 | 10.3s |
| #200 | GLM 4.7 Flash medium | Z.ai | 2 | 4.3 | $0.166 | 4/22 | 142.6s |
| #201 | Elephant Alpha medium | Openrouter | 2 | 4.3 | $0.000 | 6/21 | 1.27s |
| #202 | Hunter Alpha none | OpenRouter | 2 | 4.2 | $0.000 | 6/18 | 4.70s |
| #206 | MiMo-V2-Flash none | Xiaomi | 2 | 4.0 | $0.025 | 4/21 | 2.76s |
| #208 | Grok Build 0.1 none | X AI | 2 | 4.0 | $0.547 | 7/19 | 28.7s |
| #212 | gpt-oss-120b none | OpenAI | 2 | 3.7 | $0.010 | 6/19 | 21.6s |
| #214 | Nemotron 3 Nano Omni 30b A3b Reasoning none | NVIDIA | 2 | 3.2 | $0.000 | 2/19 | 728ms |
| #24 | GPT-5.2 medium | OpenAI | 3 | 8.4 | $0.951 | 14/22 | 22.6s |
| #29 | GPT-5 Mini medium | OpenAI | 3 | 8.1 | $0.237 | 12/22 | 27.6s |