AI BENCHY Fehler
Keine Antwort-Fehler
Sieh, bei welchen KI-Modellen Keine Antwort besonders häufig auftritt, damit du Zuverlässigkeitsrisiken vor der Auswahl erkennst.
Kategorien
In der Kategorie Programmierung18 In der Kategorie Allgemeinwissen10 In der Kategorie Domänenspezifisch7 In der Kategorie Datenanalyse und -extraktion5 In der Kategorie Anti-KI-Tricks4 In der Kategorie Kombiniert3 In der Kategorie Befolgung von Anweisungen2 In der Kategorie Rätsellösen2 In der Kategorie Werkzeugaufrufe2
37/37
Modelle filtern
Keine Modelle entsprechen der aktuellen Suche und den Filtern.
| Rang | Modell | Unternehmen | Keine Antwort-Anzahl | Punktzahl | Gesamtkosten | Korrekte Tests | Antwortzeit (Durchschnitt) |
|---|---|---|---|---|---|---|---|
| #76 | Step 3.7 Flash high | Stepfun | 4 | 7.1 | $1.148 | 11/21 | 64.5s |
| #95 | Qwen3.6 27B medium | Qwen | 3 | 6.6 | $0.336 | 10/21 | 59.7s |
| #177 | GLM 4.7 Flash medium | Z.ai | 3 | 4.3 | $0.054 | 4/21 | 35.1s |
| #9 | Claude Fable 5 medium | Anthropic | 2 | 9.2 | $3.165 | 17/21 | 17.0s |
| #17 | GLM 5.2 medium | Z.ai | 2 | 8.7 | $0.179 | 15/21 | 23.3s |
| #56 | Kimi K2.5 medium | Moonshot AI | 2 | 7.5 | $0.348 | 10/21 | 98.4s |
| #72 | Gemma 4 26B A4B medium | 2 | 7.2 | $0.045 | 14/21 | 63.4s | |
| #87 | Mimo V2 Omni medium | Xiaomi | 2 | 6.8 | $0.683 | 10/21 | 41.2s |
| #104 | Qwen3.5-35B-A3B medium | Qwen | 2 | 6.3 | $0.401 | 11/21 | 72.6s |
| #132 | Claude Sonnet 5 none | Anthropic | 2 | 5.7 | $0.287 | 7/21 | 4.74s |
| #176 | Laguna Xs.2 medium | Poolside | 2 | 4.3 | $0.015 | 6/19 | 6.73s |
| #185 | Qwen3.5-9B medium | Qwen | 2 | 3.8 | $0.036 | 3/21 | 82.2s |
| #15 | Claude Opus 4.8 medium | Anthropic | 1 | 8.8 | $1.107 | 17/21 | 9.72s |
| #18 | GLM 5 medium | Z.ai | 1 | 8.6 | $0.228 | 15/21 | 33.5s |
| #23 | Step 3.7 Flash medium | Stepfun | 1 | 8.5 | $0.376 | 14/21 | 20.4s |