Allgemeinwissen: Falsche Antwort
Allgemeinwissen
Falsche Antwort
Sieh, welche KI-Modelle bei Allgemeinwissen am ehesten auf Falsche Antwort stoßen, damit du Schwachstellen schneller erkennst.
Fehlergründe
197/197
Modelle filtern
Keine Modelle entsprechen der aktuellen Suche und den Filtern.
| Rang | Modell | Unternehmen | Falsche Antwort-Anzahl | Kategorie-Score | Gesamtkosten | Korrekte Tests | Antwortzeit (Durchschnitt) |
|---|---|---|---|---|---|---|---|
| #30 | Muse Spark 1.2 low | Meta | 1 | 3.0 | $0.650 | 0/1 | 10.00s |
| #31 | Qwen3.6 Max Preview medium | Qwen | 1 | 3.0 | $1.129 | 0/1 | 60.6s |
| #32 | Grok 4.5 low | X AI | 1 | 3.0 | $0.935 | 0/1 | 14.0s |
| #33 | GPT-5.2 medium | OpenAI | 1 | 3.0 | $0.951 | 0/1 | 28.2s |
| #34 | Inkling Small high | Thinkingmachines | 1 | 3.0 | $0.416 | 0/1 | 49.3s |
| #35 | Grok 4.5 medium | X AI | 1 | 3.0 | $1.928 | 0/1 | 74.4s |
| #36 | Claude Sonnet 5 medium | Anthropic | 1 | 3.0 | $0.922 | 0/1 | 7.06s |
| #37 | Muse Spark 1.1 low | Meta | 1 | 3.0 | $0.647 | 0/1 | 8.17s |
| #38 | Gemini 2.5 Flash medium | 1 | 3.0 | $0.643 | 0/1 | 2.76s | |
| #39 | DeepSeek V4 Flash 0731 low | DeepSeek | 1 | 3.0 | $0.034 | 0/1 | 246.9s |
| #40 | GPT-5 Mini medium | OpenAI | 1 | 3.0 | $0.237 | 0/1 | 9.99s |
| #41 | Muse Spark 1.1 high | Meta | 1 | 3.0 | $1.694 | 0/1 | 22.9s |
| #42 | Inkling high | Thinkingmachines | 1 | 3.0 | $1.006 | 0/1 | 153.6s |
| #44 | GPT-5.2 Chat none | OpenAI | 1 | 3.0 | $0.604 | 0/1 | 6.89s |
| #45 | GLM 5.2 high | Z.ai | 1 | 3.0 | $0.778 | 0/1 | 127.8s |