Programmierung: Anweisungen nicht befolgt
Programmierung
Anweisungen nicht befolgt
Sieh, welche KI-Modelle bei Programmierung am ehesten auf Anweisungen nicht befolgt stoßen, damit du Schwachstellen schneller erkennst. Sortieren nach: Gesamtkosten ↑.
Fehlergründe
38/38
Modelle filtern
Keine Modelle entsprechen der aktuellen Suche und den Filtern.
| Rang | Modell | Unternehmen | Anweisungen nicht befolgt-Anzahl | Kategorie-Score | Gesamtkosten | Korrekte Tests | Antwortzeit (Durchschnitt) |
|---|---|---|---|---|---|---|---|
| #231 | Ling 3.1 Flash low | Inclusionai | 1 | 0.6 | $0.000 | 1/3 | 107.3s |
| #283 | Ling 3.1 Flash none | Inclusionai | 1 | 0.5 | $0.000 | 0/3 | 31.9s |
| #356 | Cobuddy medium | Baidu | 1 | 0.4 | $0.000 | 0/3 | 79.2s |
| #373 | Ling 3.0 Tiny high | Inclusionai | 1 | 0.3 | $0.000 | 0/3 | 177.7s |
| #374 | Ling 3.0 Tiny low | Inclusionai | 1 | 0.3 | $0.000 | 0/3 | 170.7s |
| #375 | Ling 3.0 Tiny medium | Inclusionai | 1 | 0.3 | $0.000 | 0/3 | 212.0s |
| #371 | Granite 4.1 8b default | IBM Granite | 1 | 0.4 | $0.007 | 0/3 | 775ms |
| #385 | MiMo-V2-Flash default | Xiaomi | 1 | 0.4 | $0.025 | 0/3 | 2.64s |
| #363 | Mercury 2.5 none | Inception | 1 | 0.4 | $0.026 | 0/3 | 12.5s |
| #369 | Laguna M.1 medium | Poolside | 1 | 0.1 | $0.033 | 0/1 | 35.6s |
| #206 | Mercury 2.5 Preview high | Inception | 1 | 0.7 | $0.040 | 1/3 | 6.13s |
| #293 | MiMo-V2.6-Flash none | Xiaomi | 1 | 0.4 | $0.060 | 0/3 | 744ms |
| #64 | Claude Haiku 5.5 low | Anthropic | 1 | 0.8 | $0.061 | 2/3 | 7.30s |
| #368 | Grok 4.1 Fast medium | X AI | 1 | 0.8 | $0.069 | 0/1 | 23.6s |
| #139 | DeepSeek V4 Pro 0423 none | DeepSeek | 1 | 0.6 | $0.083 | 1/3 | 13.4s |