Anweisungen nicht befolgt-Fehler
Sieh, bei welchen KI-Modellen Anweisungen nicht befolgt besonders häufig auftritt, damit du Zuverlässigkeitsrisiken vor der Auswahl erkennst.
Kategorien
In der Kategorie Rätsellösen128 In der Kategorie Allgemeine Intelligenz115 In der Kategorie Befolgung von Anweisungen48 In der Kategorie Anti-KI-Tricks44 In der Kategorie Programmierung29 In der Kategorie Werkzeugaufrufe12 In der Kategorie Datenanalyse und -extraktion7 In der Kategorie Domänenspezifisch2 In der Kategorie Kombiniert1
215/215
Modelle filtern
Keine Modelle entsprechen der aktuellen Suche und den Filtern.
| Rang | Modell | Unternehmen | Anweisungen nicht befolgt-Anzahl | Punktzahl | Gesamtkosten | Korrekte Tests | Antwortzeit (Durchschnitt) |
|---|---|---|---|---|---|---|---|
| #264 | MiniMax M2.7 medium | Minimax | 5 | 5.0 | $0.208 | 5/22 | 43.2s |
| #165 | Inkling Small medium | Thinkingmachines | 4 | 6.6 | $0.113 | 10/22 | 6.30s |
| #194 | Trinity Large Thinking medium | Arcee AI | 4 | 6.1 | $0.756 | 8/22 | 85.4s |
| #232 | Nemotron 3.5 Lightning high | NVIDIA | 4 | 5.6 | $0.134 | 5/22 | 58.3s |
| #242 | MiMo-V2.5-Pro none | Xiaomi | 4 | 5.4 | $0.068 | 5/22 | 4.24s |
| #277 | Trinity Large Thinking high | Arcee AI | 4 | 4.8 | $0.592 | 5/22 | 75.9s |
| #283 | Grok 4.1 Fast medium | X AI | 4 | 4.7 | $0.069 | 9/19 | 23.8s |
| #300 | Hy3 preview none | Tencent | 4 | 4.0 | $0.007 | 4/21 | 12.9s |
| #302 | Ling 3.0 Tiny none | Inclusionai | 4 | 4.0 | $0.000 | 2/22 | 14.0s |
| #303 | Granite 4.1 8B none | IBM Granite | 4 | 4.0 | $0.007 | 2/22 | 1.44s |
| #307 | Ling 3.0 Tiny low | Inclusionai | 4 | 3.8 | $0.000 | 4/22 | 66.2s |
| #310 | Ling 3.0 Tiny medium | Inclusionai | 4 | 3.8 | $0.000 | 4/22 | 68.1s |
| #41 | Muse Spark 1.2 high | Meta | 3 | 8.7 | $1.771 | 14/22 | 26.6s |
| #42 | Muse Spark 1.2 medium | Meta | 3 | 8.6 | $1.339 | 14/22 | 19.7s |
| #49 | Muse Spark 1.2 low | Meta | 3 | 8.4 | $0.655 | 15/22 | 9.77s |