Falsche Antwort-Fehler
Sieh, bei welchen KI-Modellen Falsche Antwort besonders häufig auftritt, damit du Zuverlässigkeitsrisiken vor der Auswahl erkennst. Sortieren nach: Antwortzeit (Durchschnitt) ↑.
Angezeigte Modelle
15
Gesamtfehler
1558
Am stärksten betroffenes Modell
Nemotron 3 Nano Omni 30b A3b Reasoning 9Kategorien
In der Kategorie Domänenspezifisch412 In der Kategorie Anti-KI-Tricks293 In der Kategorie Programmierung252 In der Kategorie Rätsellösen201 In der Kategorie Allgemeinwissen168 In der Kategorie Kombiniert68 In der Kategorie Befolgung von Anweisungen61 In der Kategorie Allgemeine Intelligenz59 In der Kategorie Datenanalyse und -extraktion41 In der Kategorie Werkzeugaufrufe3
209/209
Modelle filtern
Keine Modelle entsprechen der aktuellen Suche und den Filtern.
| Rang | Modell | Unternehmen | Falsche Antwort-Anzahl | Punktzahl | Gesamtkosten | Korrekte Tests | Antwortzeit (Durchschnitt) |
|---|---|---|---|---|---|---|---|
| #132 | GPT-5.6 Terra none | OpenAI | 11 | 6.0 | $0.349 | 8/22 | 1.65s |
| #122 | Gemini 3.1 Flash Lite none | 11 | 6.1 | $0.046 | 9/22 | 1.75s | |
| #120 | Gemini 3.1 Flash Lite minimal | 8 | 6.1 | $0.047 | 10/22 | 1.86s | |
| #174 | GPT-4o-mini none | OpenAI | 15 | 5.0 | $0.010 | 5/22 | 1.99s |
| #139 | GPT-5.4 none | OpenAI | 14 | 5.8 | $0.397 | 7/22 | 2.07s |
| #83 | GPT-5.6 Sol none | OpenAI | 10 | 6.9 | $0.524 | 11/22 | 2.16s |
| #147 | Mimo V2 PRO none | Xiaomi | 11 | 5.6 | $0.045 | 7/21 | 2.27s |
| #87 | GPT-5.5 none | OpenAI | 11 | 6.9 | $0.544 | 11/22 | 2.36s |
| #157 | Mimo V2 Omni none | Xiaomi | 10 | 5.5 | $0.021 | 8/21 | 2.44s |
| #180 | GPT-5.4 Nano none | OpenAI | 15 | 4.8 | $0.041 | 4/22 | 2.57s |
| #88 | Gemini 3.5 Flash minimal | 5 | 6.8 | $0.300 | 14/22 | 2.65s | |
| #78 | Mercury 2 medium | Inception | 8 | 7.0 | $0.093 | 10/22 | 2.72s |
| #200 | MiMo-V2-Flash none | Xiaomi | 13 | 4.0 | $0.025 | 4/21 | 2.76s |
| #170 | GLM 5 Turbo none | Z.ai | 13 | 5.1 | $0.047 | 6/21 | 2.82s |
| #192 | Laguna M.1 none | Poolside | 10 | 4.4 | $0.009 | 4/19 | 2.89s |