Fehler-Ranking für Falsche Antwort

Sieh, bei welchen KI-Modellen Falsche Antwort besonders häufig auftritt, damit du Zuverlässigkeitsrisiken vor der Auswahl erkennst. Sortieren nach: Punktzahl ↓.

Angezeigte Modelle

Gesamtfehler

1585

Am stärksten betroffenes Modell

Gemini 3.6 Flash 1

Kategorien

In der Kategorie Domänenspezifisch421 In der Kategorie Anti-KI-Tricks293 In der Kategorie Programmierung259 In der Kategorie Rätsellösen204 In der Kategorie Allgemeinwissen172 In der Kategorie Kombiniert69 In der Kategorie Allgemeine Intelligenz62 In der Kategorie Befolgung von Anweisungen61 In der Kategorie Datenanalyse und -extraktion41 In der Kategorie Werkzeugaufrufe3

215/215

Rang	Modell	Unternehmen	Falsche Antwort-Anzahl	Punktzahl	Gesamtkosten	Korrekte Tests	Antwortzeit (Durchschnitt)
#137	Grok 4.20 Beta medium	X AI	3	6.0	$0.750	14/18	9.75s
Gesamttests 18 Falsche Tests 4 Gesamtkosten $0.750 Antwortzeit (Durchschnitt) 9.75s
#138	GPT-5.6 Terra none	OpenAI	11	6.0	$0.349	8/22	1.65s
Gesamttests 22 Falsche Tests 14 Gesamtkosten $0.349 Antwortzeit (Durchschnitt) 1.65s
#139	Gemini 3 PRO Preview medium	Google	3	6.0	$0.385	14/21	9.05s
Gesamttests 21 Falsche Tests 7 Gesamtkosten $0.385 Antwortzeit (Durchschnitt) 9.05s
#140	Mimo V2 Omni medium	Xiaomi	5	5.9	$0.683	10/21	41.2s
Gesamttests 21 Falsche Tests 11 Gesamtkosten $0.683 Antwortzeit (Durchschnitt) 41.2s
#141	Hy3 preview high	Tencent	3	5.9	$0.048	11/21	56.6s
Gesamttests 21 Falsche Tests 10 Gesamtkosten $0.048 Antwortzeit (Durchschnitt) 56.6s
#142	GPT-5.4 Mini none	OpenAI	13	5.9	$0.095	6/22	1.53s
Gesamttests 22 Falsche Tests 16 Gesamtkosten $0.095 Antwortzeit (Durchschnitt) 1.53s
#143	North Mini Code medium	Cohere	9	5.9	$0.000	9/22	137.1s
Gesamttests 22 Falsche Tests 13 Gesamtkosten $0.000 Antwortzeit (Durchschnitt) 137.1s
#144	Kimi K2.6 none	Moonshot AI	11	5.8	$0.184	7/22	19.6s
Gesamttests 22 Falsche Tests 15 Gesamtkosten $0.184 Antwortzeit (Durchschnitt) 19.6s
#145	GPT-5.4 none	OpenAI	14	5.8	$0.397	7/22	2.07s
Gesamttests 22 Falsche Tests 15 Gesamtkosten $0.397 Antwortzeit (Durchschnitt) 2.07s
#146	Nemotron 3 Super medium	NVIDIA	5	5.7	$0.055	8/22	52.0s
Gesamttests 22 Falsche Tests 14 Gesamtkosten $0.055 Antwortzeit (Durchschnitt) 52.0s
#147	GLM 5 none	Z.ai	12	5.7	$0.041	9/21	4.03s
Gesamttests 21 Falsche Tests 12 Gesamtkosten $0.041 Antwortzeit (Durchschnitt) 4.03s
#148	Qwen3.5-122B-A10B none	Qwen	13	5.7	$0.247	6/22	12.9s
Gesamttests 22 Falsche Tests 16 Gesamtkosten $0.247 Antwortzeit (Durchschnitt) 12.9s
#149	Gemini 3.1 Flash Lite high	Google	4	5.6	$2.044	10/18	62.0s
Gesamttests 18 Falsche Tests 8 Gesamtkosten $2.044 Antwortzeit (Durchschnitt) 62.0s
#150	KAT-Coder-Air V2.5 high	Kwaipilot	9	5.6	$0.077	7/22	15.9s
Gesamttests 22 Falsche Tests 15 Gesamtkosten $0.077 Antwortzeit (Durchschnitt) 15.9s
#151	GLM 5V Turbo none	Z.ai	11	5.6	$0.052	8/21	2.99s
Gesamttests 21 Falsche Tests 13 Gesamtkosten $0.052 Antwortzeit (Durchschnitt) 2.99s

←

1 9 10 11 15

→

Falsche Antwort-Fehler

Modelle filtern

Top-Modelle nach Falsche Antwort-Anzahl

Falsche Antwort-Anzahl vs Punktzahl

Top-Modelle nach Antwortzeit (Durchschnitt)