Falsche Antwort-Fehler
Sieh, bei welchen KI-Modellen Falsche Antwort besonders häufig auftritt, damit du Zuverlässigkeitsrisiken vor der Auswahl erkennst. Sortieren nach: Gesamtkosten ↑.
Kategorien
In der Kategorie Domänenspezifisch433 In der Kategorie Anti-KI-Tricks306 In der Kategorie Programmierung266 In der Kategorie Rätsellösen214 In der Kategorie Allgemeinwissen176 In der Kategorie Kombiniert71 In der Kategorie Allgemeine Intelligenz66 In der Kategorie Befolgung von Anweisungen65 In der Kategorie Datenanalyse und -extraktion41 In der Kategorie Werkzeugaufrufe4
219/219
Modelle filtern
Keine Modelle entsprechen der aktuellen Suche und den Filtern.
| Rang | Modell | Unternehmen | Falsche Antwort-Anzahl | Punktzahl | Gesamtkosten | Korrekte Tests | Antwortzeit (Durchschnitt) |
|---|---|---|---|---|---|---|---|
| #214 | Qwen3.5-9B medium | Qwen | 2 | 3.8 | $0.036 | 3/22 | 82.2s |
| #147 | GLM 5 none | Z.ai | 12 | 5.7 | $0.041 | 9/21 | 4.03s |
| #189 | GPT-5.4 Nano none | OpenAI | 15 | 4.8 | $0.041 | 4/22 | 2.57s |
| #165 | KAT-Coder-Air V2.5 low | Kwaipilot | 7 | 5.4 | $0.041 | 7/22 | 10.1s |
| #49 | DeepSeek V4 Flash high | DeepSeek | 6 | 7.7 | $0.042 | 13/22 | 49.7s |
| #119 | MiMo-V2-Flash medium | Xiaomi | 5 | 6.3 | $0.043 | 12/21 | 20.1s |
| #156 | DeepSeek V4 Flash none | DeepSeek | 12 | 5.6 | $0.044 | 5/22 | 36.8s |
| #117 | LongCat 2.0 none | Meituan | 14 | 6.3 | $0.044 | 7/22 | 5.18s |
| #153 | Mimo V2 PRO none | Xiaomi | 11 | 5.6 | $0.045 | 7/21 | 2.27s |
| #128 | Gemini 3.1 Flash Lite none | 11 | 6.1 | $0.046 | 9/22 | 1.75s | |
| #178 | GLM 5 Turbo none | Z.ai | 13 | 5.1 | $0.047 | 6/21 | 2.82s |
| #126 | Gemini 3.1 Flash Lite minimal | 8 | 6.1 | $0.047 | 10/22 | 1.86s | |
| #141 | Hy3 preview high | Tencent | 3 | 5.9 | $0.048 | 11/21 | 56.6s |
| #155 | KAT-Coder-Air V2.5 medium | Kwaipilot | 11 | 5.6 | $0.048 | 8/22 | 8.42s |
| #151 | GLM 5V Turbo none | Z.ai | 11 | 5.6 | $0.052 | 8/21 | 2.99s |