Fehler-Ranking für Falsche Antwort

Sieh, bei welchen KI-Modellen Falsche Antwort besonders häufig auftritt, damit du Zuverlässigkeitsrisiken vor der Auswahl erkennst.

Angezeigte Modelle

Gesamtfehler

1585

Am stärksten betroffenes Modell

Mercury 2 17

Kategorien

In der Kategorie Domänenspezifisch421 In der Kategorie Anti-KI-Tricks293 In der Kategorie Programmierung259 In der Kategorie Rätsellösen204 In der Kategorie Allgemeinwissen172 In der Kategorie Kombiniert69 In der Kategorie Allgemeine Intelligenz62 In der Kategorie Befolgung von Anweisungen61 In der Kategorie Datenanalyse und -extraktion41 In der Kategorie Werkzeugaufrufe3

215/215

Rang	Modell	Unternehmen	Falsche Antwort-Anzahl	Punktzahl	Gesamtkosten	Korrekte Tests	Antwortzeit (Durchschnitt)
#93	Gemini 3 Flash Preview none	Google	8	6.8	$0.085	13/22	2.95s
Gesamttests 22 Falsche Tests 9 Gesamtkosten $0.085 Antwortzeit (Durchschnitt) 2.95s
#96	LongCat 2.0 low	Meituan	8	6.7	$0.391	10/22	100.3s
Gesamttests 22 Falsche Tests 12 Gesamtkosten $0.391 Antwortzeit (Durchschnitt) 100.3s
#101	GLM 5.2 none	Z.ai	8	6.6	$0.128	12/22	9.34s
Gesamttests 22 Falsche Tests 10 Gesamtkosten $0.128 Antwortzeit (Durchschnitt) 9.34s
#126	Gemini 3.1 Flash Lite minimal	Google	8	6.1	$0.047	10/22	1.86s
Gesamttests 22 Falsche Tests 12 Gesamtkosten $0.047 Antwortzeit (Durchschnitt) 1.86s
#129	Inkling low	Thinkingmachines	8	6.1	$0.187	10/22	5.15s
Gesamttests 22 Falsche Tests 12 Gesamtkosten $0.187 Antwortzeit (Durchschnitt) 5.15s
#205	Hy3 preview none	Tencent	8	4.0	$0.003	4/21	12.9s
Gesamttests 21 Falsche Tests 17 Gesamtkosten $0.003 Antwortzeit (Durchschnitt) 12.9s
#211	Laguna Xs.2 none	Poolside	8	3.8	$0.004	5/19	806ms
Gesamttests 19 Falsche Tests 14 Gesamtkosten $0.004 Antwortzeit (Durchschnitt) 806ms
#212	gpt-oss-120b none	OpenAI	8	3.7	$0.010	6/19	21.6s
Gesamttests 19 Falsche Tests 13 Gesamtkosten $0.010 Antwortzeit (Durchschnitt) 21.6s
#38	GPT-5.6 Terra high	OpenAI	7	8.0	$1.055	14/22	11.3s
Gesamttests 22 Falsche Tests 8 Gesamtkosten $1.055 Antwortzeit (Durchschnitt) 11.3s
#48	GPT-5.6 Luna high	OpenAI	7	7.7	$1.017	15/22	18.7s
Gesamttests 22 Falsche Tests 7 Gesamtkosten $1.017 Antwortzeit (Durchschnitt) 18.7s
#55	Nemotron 3 Ultra medium	NVIDIA	7	7.5	$0.774	13/22	32.2s
Gesamttests 22 Falsche Tests 9 Gesamtkosten $0.774 Antwortzeit (Durchschnitt) 32.2s
#58	GPT-5.3 Chat none	OpenAI	7	7.5	$0.571	13/22	6.88s
Gesamttests 22 Falsche Tests 9 Gesamtkosten $0.571 Antwortzeit (Durchschnitt) 6.88s
#63	Qwen3.7 Max none	Qwen	7	7.4	$0.197	15/22	4.52s
Gesamttests 22 Falsche Tests 7 Gesamtkosten $0.197 Antwortzeit (Durchschnitt) 4.52s
#64	LongCat 2.0 medium	Meituan	7	7.4	$0.478	12/22	136.6s
Gesamttests 22 Falsche Tests 10 Gesamtkosten $0.478 Antwortzeit (Durchschnitt) 136.6s
#68	Gemini 3.1 Flash Lite Preview medium	Google	7	7.3	$0.115	13/22	4.61s
Gesamttests 22 Falsche Tests 9 Gesamtkosten $0.115 Antwortzeit (Durchschnitt) 4.61s

Falsche Antwort-Fehler

Modelle filtern

Top-Modelle nach Falsche Antwort-Anzahl

Falsche Antwort-Anzahl vs Punktzahl

Top-Modelle nach Antwortzeit (Durchschnitt)