Befolgung von Anweisungen: Anweisungen nicht befolgt
Befolgung von Anweisungen
Anweisungen nicht befolgt
Sieh, welche KI-Modelle bei Befolgung von Anweisungen am ehesten auf Anweisungen nicht befolgt stoßen, damit du Schwachstellen schneller erkennst. Sortieren nach: Gesamtkosten ↑.
Fehlergründe
48/48
Modelle filtern
Keine Modelle entsprechen der aktuellen Suche und den Filtern.
| Rang | Modell | Unternehmen | Anweisungen nicht befolgt-Anzahl | Kategorie-Score | Gesamtkosten | Korrekte Tests | Antwortzeit (Durchschnitt) |
|---|---|---|---|---|---|---|---|
| #170 | Dots 3 Note Preview low | Dots Studio | 1 | 7.9 | $0.000 | 1/2 | 7.83s |
| #171 | Dots 3 Note Preview high | Dots Studio | 1 | 8.3 | $0.000 | 1/2 | 7.80s |
| #203 | Dots 3 Note Preview medium | Dots Studio | 1 | 8.5 | $0.000 | 1/2 | 7.77s |
| #247 | Dots 3 Note Preview none | Dots Studio | 1 | 4.8 | $0.000 | 0/2 | 1.06s |
| #297 | Ling 3.0 Tiny none | Inclusionai | 1 | 3.1 | $0.000 | 0/2 | 2.44s |
| #301 | Ling 3.0 Tiny high | Inclusionai | 1 | 6.8 | $0.000 | 1/2 | 3.10s |
| #302 | Ling 3.0 Tiny low | Inclusionai | 1 | 6.6 | $0.000 | 1/2 | 3.09s |
| #305 | Ling 3.0 Tiny medium | Inclusionai | 1 | 6.8 | $0.000 | 1/2 | 3.00s |
| #308 | Nemotron 3 Nano Omni 30b A3b Reasoning medium | NVIDIA | 1 | 7.3 | $0.000 | 1/2 | 1.37s |
| #309 | Nemotron 3 Nano Omni 30b A3b Reasoning none | NVIDIA | 1 | 4.8 | $0.000 | 0/2 | 541ms |
| #215 | Ling-3.0-flash none | Inclusionai | 1 | 4.8 | $0.004 | 0/2 | 836ms |
| #298 | Granite 4.1 8B none | IBM Granite | 1 | 3.6 | $0.007 | 0/2 | 344ms |
| #303 | Grok 4.1 Fast none | X AI | 1 | 3.0 | $0.008 | 0/2 | 685ms |
| #276 | Trinity Large Preview none | Arcee AI | 1 | 3.5 | $0.008 | 0/2 | 822ms |
| #239 | DeepSeek V4 Flash 0731 none | DeepSeek | 1 | 5.0 | $0.011 | 0/2 | 1.42s |