Falsche Antwort-Fehler
Sieh, bei welchen KI-Modellen Falsche Antwort besonders häufig auftritt, damit du Zuverlässigkeitsrisiken vor der Auswahl erkennst. Sortieren nach: Gesamtkosten ↓.
Angezeigte Modelle
15
Gesamtfehler
1585
Am stärksten betroffenes Modell
Grok 4.20 Multi Agent Beta 4Kategorien
In der Kategorie Domänenspezifisch421 In der Kategorie Anti-KI-Tricks293 In der Kategorie Programmierung259 In der Kategorie Rätsellösen204 In der Kategorie Allgemeinwissen172 In der Kategorie Kombiniert69 In der Kategorie Allgemeine Intelligenz62 In der Kategorie Befolgung von Anweisungen61 In der Kategorie Datenanalyse und -extraktion41 In der Kategorie Werkzeugaufrufe3
215/215
Modelle filtern
Keine Modelle entsprechen der aktuellen Suche und den Filtern.
| Rang | Modell | Unternehmen | Falsche Antwort-Anzahl | Punktzahl | Gesamtkosten | Korrekte Tests | Antwortzeit (Durchschnitt) |
|---|---|---|---|---|---|---|---|
| #72 | Kimi K2.6 medium | Moonshot AI | 3 | 7.2 | $1.036 | 12/22 | 110.0s |
| #48 | GPT-5.6 Luna high | OpenAI | 7 | 7.7 | $1.017 | 15/22 | 18.7s |
| #32 | Inkling high | Thinkingmachines | 4 | 8.0 | $1.006 | 15/22 | 64.2s |
| #5 | GPT-5.6 Sol low | OpenAI | 4 | 9.5 | $0.971 | 18/22 | 8.79s |
| #24 | GPT-5.2 medium | OpenAI | 3 | 8.4 | $0.951 | 14/22 | 22.6s |
| #23 | Grok 4.5 low | X AI | 6 | 8.4 | $0.935 | 16/22 | 15.6s |
| #26 | Claude Sonnet 5 medium | Anthropic | 4 | 8.3 | $0.922 | 16/22 | 12.5s |
| #16 | GPT-5.3-Codex medium | OpenAI | 4 | 8.9 | $0.920 | 16/22 | 17.0s |
| #125 | Qwen3.5-35B-A3B medium | Qwen | 2 | 6.2 | $0.837 | 11/22 | 112.5s |
| #1 | Gemini 3.6 Flash medium | 1 | 9.9 | $0.831 | 21/22 | 10.1s | |
| #35 | GLM 5.2 high | Z.ai | 3 | 8.0 | $0.817 | 14/22 | 62.7s |
| #77 | Grok 4.3 medium | X AI | 5 | 7.1 | $0.779 | 13/22 | 47.4s |
| #105 | Qwen3.6 27B medium | Qwen | 6 | 6.5 | $0.779 | 10/22 | 106.3s |
| #79 | Grok 4.20 medium | X AI | 6 | 7.1 | $0.777 | 12/22 | 29.5s |
| #55 | Nemotron 3 Ultra medium | NVIDIA | 7 | 7.5 | $0.774 | 13/22 | 32.2s |