Fehler-Ranking für Falsche Antwort

Sieh, bei welchen KI-Modellen Falsche Antwort besonders häufig auftritt, damit du Zuverlässigkeitsrisiken vor der Auswahl erkennst. Sortieren nach: Antwortzeit (Durchschnitt) ↑.

Angezeigte Modelle

Gesamtfehler

1585

Am stärksten betroffenes Modell

Nemotron 3 Nano Omni 30b A3b Reasoning 9

Kategorien

In der Kategorie Domänenspezifisch421 In der Kategorie Anti-KI-Tricks293 In der Kategorie Programmierung259 In der Kategorie Rätsellösen204 In der Kategorie Allgemeinwissen172 In der Kategorie Kombiniert69 In der Kategorie Allgemeine Intelligenz62 In der Kategorie Befolgung von Anweisungen61 In der Kategorie Datenanalyse und -extraktion41 In der Kategorie Werkzeugaufrufe3

215/215

Rang	Modell	Unternehmen	Falsche Antwort-Anzahl	Punktzahl	Gesamtkosten	Korrekte Tests	Antwortzeit (Durchschnitt)
#213	Nemotron 3 Nano Omni 30b A3b Reasoning medium	NVIDIA	7	3.4	$0.000	4/19	17.1s
Gesamttests 19 Falsche Tests 15 Gesamtkosten $0.000 Antwortzeit (Durchschnitt) 17.1s
#20	Claude Fable 5 medium	Anthropic	2	8.6	$3.478	17/22	17.2s
Gesamttests 22 Falsche Tests 5 Gesamtkosten $3.478 Antwortzeit (Durchschnitt) 17.2s
#179	DeepSeek V3.2 none	DeepSeek	7	5.0	$0.054	6/22	18.3s
Gesamttests 22 Falsche Tests 16 Gesamtkosten $0.054 Antwortzeit (Durchschnitt) 18.3s
#48	GPT-5.6 Luna high	OpenAI	7	7.7	$1.017	15/22	18.7s
Gesamttests 22 Falsche Tests 7 Gesamtkosten $1.017 Antwortzeit (Durchschnitt) 18.7s
#161	Kimi K2.5 none	Moonshot AI	15	5.5	$0.127	6/22	19.2s
Gesamttests 22 Falsche Tests 16 Gesamtkosten $0.127 Antwortzeit (Durchschnitt) 19.2s
#175	Qwen3.5-9B none	Qwen	14	5.1	$0.021	4/22	19.2s
Gesamttests 22 Falsche Tests 18 Gesamtkosten $0.021 Antwortzeit (Durchschnitt) 19.2s
#3	Gemini 3 Flash Preview medium	Google	1	9.6	$0.742	21/22	19.2s
Gesamttests 22 Falsche Tests 1 Gesamtkosten $0.742 Antwortzeit (Durchschnitt) 19.2s
#66	KAT-Coder-Pro V2.5 low	Kwaipilot	10	7.4	$0.387	11/22	19.5s
Gesamttests 22 Falsche Tests 11 Gesamtkosten $0.387 Antwortzeit (Durchschnitt) 19.5s
#144	Kimi K2.6 none	Moonshot AI	11	5.8	$0.184	7/22	19.6s
Gesamttests 22 Falsche Tests 15 Gesamtkosten $0.184 Antwortzeit (Durchschnitt) 19.6s
#119	MiMo-V2-Flash medium	Xiaomi	5	6.3	$0.043	12/21	20.1s
Gesamttests 21 Falsche Tests 9 Gesamtkosten $0.043 Antwortzeit (Durchschnitt) 20.1s
#71	Step 3.7 Flash low	Stepfun	8	7.3	$0.454	12/22	20.7s
Gesamttests 22 Falsche Tests 10 Gesamtkosten $0.454 Antwortzeit (Durchschnitt) 20.7s
#73	KAT-Coder-Pro V2.5 high	Kwaipilot	10	7.2	$0.482	11/22	20.8s
Gesamttests 22 Falsche Tests 11 Gesamtkosten $0.482 Antwortzeit (Durchschnitt) 20.8s
#28	Gemini 2.5 Flash medium	Google	6	8.2	$0.643	15/22	21.2s
Gesamttests 22 Falsche Tests 7 Gesamtkosten $0.643 Antwortzeit (Durchschnitt) 21.2s
#10	Gemini 3.1 Pro Preview medium	Google	2	9.2	$1.361	20/22	21.5s
Gesamttests 22 Falsche Tests 2 Gesamtkosten $1.361 Antwortzeit (Durchschnitt) 21.5s
#212	gpt-oss-120b none	OpenAI	8	3.7	$0.010	6/19	21.6s
Gesamttests 19 Falsche Tests 13 Gesamtkosten $0.010 Antwortzeit (Durchschnitt) 21.6s

Falsche Antwort-Fehler

Modelle filtern

Top-Modelle nach Falsche Antwort-Anzahl

Falsche Antwort-Anzahl vs Punktzahl

Top-Modelle nach Antwortzeit (Durchschnitt)