Allgemeinwissen: Falsche Antwort
Allgemeinwissen
Falsche Antwort
Sieh, welche KI-Modelle bei Allgemeinwissen am ehesten auf Falsche Antwort stoßen, damit du Schwachstellen schneller erkennst.
Fehlergründe
259/259
Modelle filtern
Keine Modelle entsprechen der aktuellen Suche und den Filtern.
| Rang | Modell | Unternehmen | Falsche Antwort-Anzahl | Kategorie-Score | Gesamtkosten | Korrekte Tests | Antwortzeit (Durchschnitt) |
|---|---|---|---|---|---|---|---|
| #262 | Qwen3.6 35B A3B none | Qwen | 1 | 3.0 | $0.051 | 0/1 | 414ms |
| #263 | Dots 3 Note Preview none | Dots Studio | 1 | 3.0 | $0.000 | 0/1 | 961ms |
| #264 | Inkling none | Thinkingmachines | 1 | 3.0 | $0.147 | 0/1 | 670ms |
| #265 | Granite 4.2 8B medium | IBM Granite | 1 | 3.0 | $0.008 | 0/1 | 2.24s |
| #266 | Nemotron 3.5 Lightning medium | NVIDIA | 1 | 3.0 | $0.156 | 0/1 | 44.0s |
| #267 | Mistral Small 4 none | Mistral | 1 | 3.0 | $0.022 | 0/1 | 397ms |
| #268 | Mistral Small 4 medium | Mistral | 1 | 3.0 | $0.097 | 0/1 | 5.92s |
| #269 | Granite 4.2 8B low | IBM Granite | 1 | 3.0 | $0.012 | 0/1 | 5.53s |
| #270 | Qwen3 Coder Next none | Qwen | 1 | 3.0 | $0.026 | 0/1 | 601ms |
| #271 | Mercury 2.5 low | Inception | 1 | 3.0 | $0.011 | 0/1 | 782ms |
| #272 | MiMo-V2.5 none | Xiaomi | 1 | 3.0 | $0.025 | 0/1 | 3.89s |
| #273 | Qwen3.5-9B none | Qwen | 1 | 3.0 | $0.021 | 0/1 | 2.32s |
| #274 | GLM 5 Turbo none | Z.ai | 1 | 3.0 | $0.047 | 0/1 | 2.37s |
| #275 | North Mini Code none | Cohere | 1 | 3.0 | $0.000 | 0/1 | 37.4s |
| #276 | MiniMax M2.7 medium | Minimax | 1 | 3.0 | $0.208 | 0/1 | 22.8s |