Fehler-Ranking für Falsche Antwort

Sieh, bei welchen KI-Modellen Falsche Antwort besonders häufig auftritt, damit du Zuverlässigkeitsrisiken vor der Auswahl erkennst. Sortieren nach: Antwortzeit (Durchschnitt) ↑.

Angezeigte Modelle

Gesamtfehler

1585

Am stärksten betroffenes Modell

Nemotron 3 Nano Omni 30b A3b Reasoning 9

Kategorien

In der Kategorie Domänenspezifisch421 In der Kategorie Anti-KI-Tricks293 In der Kategorie Programmierung259 In der Kategorie Rätsellösen204 In der Kategorie Allgemeinwissen172 In der Kategorie Kombiniert69 In der Kategorie Allgemeine Intelligenz62 In der Kategorie Befolgung von Anweisungen61 In der Kategorie Datenanalyse und -extraktion41 In der Kategorie Werkzeugaufrufe3

215/215

Rang	Modell	Unternehmen	Falsche Antwort-Anzahl	Punktzahl	Gesamtkosten	Korrekte Tests	Antwortzeit (Durchschnitt)
#148	Qwen3.5-122B-A10B none	Qwen	13	5.7	$0.247	6/22	12.9s
Gesamttests 22 Falsche Tests 16 Gesamtkosten $0.247 Antwortzeit (Durchschnitt) 12.9s
#205	Hy3 preview none	Tencent	8	4.0	$0.003	4/21	12.9s
Gesamttests 21 Falsche Tests 17 Gesamtkosten $0.003 Antwortzeit (Durchschnitt) 12.9s
#57	GPT-5.4 Nano medium	OpenAI	8	7.5	$0.138	12/22	13.2s
Gesamttests 22 Falsche Tests 10 Gesamtkosten $0.138 Antwortzeit (Durchschnitt) 13.2s
#132	Qwen3.5 Plus 2026-04-20 none	Qwen	12	6.1	$0.122	8/22	13.6s
Gesamttests 22 Falsche Tests 14 Gesamtkosten $0.122 Antwortzeit (Durchschnitt) 13.6s
#192	Laguna M.1 medium	Poolside	4	4.7	$0.033	9/19	14.7s
Gesamttests 19 Falsche Tests 10 Gesamtkosten $0.033 Antwortzeit (Durchschnitt) 14.7s
#2	Gemini 3.6 Flash high	Google	1	9.7	$1.785	21/22	14.9s
Gesamttests 22 Falsche Tests 1 Gesamtkosten $1.785 Antwortzeit (Durchschnitt) 14.9s
#4	Gemini 3.5 Flash high	Google	1	9.5	$1.976	20/22	15.1s
Gesamttests 22 Falsche Tests 2 Gesamtkosten $1.976 Antwortzeit (Durchschnitt) 15.1s
#181	Qwen3.6 Plus Preview medium	Qwen	2	4.9	$0.000	9/19	15.2s
Gesamttests 19 Falsche Tests 10 Gesamtkosten $0.000 Antwortzeit (Durchschnitt) 15.2s
#23	Grok 4.5 low	X AI	6	8.4	$0.935	16/22	15.6s
Gesamttests 22 Falsche Tests 6 Gesamtkosten $0.935 Antwortzeit (Durchschnitt) 15.6s
#150	KAT-Coder-Air V2.5 high	Kwaipilot	9	5.6	$0.077	7/22	15.9s
Gesamttests 22 Falsche Tests 15 Gesamtkosten $0.077 Antwortzeit (Durchschnitt) 15.9s
#36	Inkling medium	Thinkingmachines	4	8.0	$0.391	15/22	16.2s
Gesamttests 22 Falsche Tests 7 Gesamtkosten $0.391 Antwortzeit (Durchschnitt) 16.2s
#111	Gemini 3.1 Flash Lite low	Google	9	6.5	$0.621	12/22	16.3s
Gesamttests 22 Falsche Tests 10 Gesamtkosten $0.621 Antwortzeit (Durchschnitt) 16.3s
#106	Hy3 preview medium	Tencent	3	6.5	$0.018	14/21	16.3s
Gesamttests 21 Falsche Tests 7 Gesamtkosten $0.018 Antwortzeit (Durchschnitt) 16.3s
#110	Gemini 3.1 Flash Lite Preview low	Google	7	6.5	$0.646	13/22	16.7s
Gesamttests 22 Falsche Tests 9 Gesamtkosten $0.646 Antwortzeit (Durchschnitt) 16.7s
#16	GPT-5.3-Codex medium	OpenAI	4	8.9	$0.920	16/22	17.0s
Gesamttests 22 Falsche Tests 6 Gesamtkosten $0.920 Antwortzeit (Durchschnitt) 17.0s

Falsche Antwort-Fehler

Modelle filtern

Top-Modelle nach Falsche Antwort-Anzahl

Falsche Antwort-Anzahl vs Punktzahl

Top-Modelle nach Antwortzeit (Durchschnitt)