Fehler-Ranking für Falsche Antwort

Sieh, bei welchen KI-Modellen Falsche Antwort besonders häufig auftritt, damit du Zuverlässigkeitsrisiken vor der Auswahl erkennst. Sortieren nach: Antwortzeit (Durchschnitt) ↑.

Angezeigte Modelle

Gesamtfehler

1585

Am stärksten betroffenes Modell

Nemotron 3 Nano Omni 30b A3b Reasoning 9

Kategorien

In der Kategorie Domänenspezifisch421 In der Kategorie Anti-KI-Tricks293 In der Kategorie Programmierung259 In der Kategorie Rätsellösen204 In der Kategorie Allgemeinwissen172 In der Kategorie Kombiniert69 In der Kategorie Allgemeine Intelligenz62 In der Kategorie Befolgung von Anweisungen61 In der Kategorie Datenanalyse und -extraktion41 In der Kategorie Werkzeugaufrufe3

215/215

Rang	Modell	Unternehmen	Falsche Antwort-Anzahl	Punktzahl	Gesamtkosten	Korrekte Tests	Antwortzeit (Durchschnitt)
#127	gpt-oss-120b medium	OpenAI	9	6.1	$0.019	9/22	21.9s
Gesamttests 22 Falsche Tests 13 Gesamtkosten $0.019 Antwortzeit (Durchschnitt) 21.9s
#115	Mimo V2 PRO medium	Xiaomi	5	6.3	$0.333	12/21	22.2s
Gesamttests 21 Falsche Tests 9 Gesamtkosten $0.333 Antwortzeit (Durchschnitt) 22.2s
#24	GPT-5.2 medium	OpenAI	3	8.4	$0.951	14/22	22.6s
Gesamttests 22 Falsche Tests 8 Gesamtkosten $0.951 Antwortzeit (Durchschnitt) 22.6s
#53	GLM 5 Turbo medium	Z.ai	4	7.6	$0.323	14/21	23.0s
Gesamttests 21 Falsche Tests 7 Gesamtkosten $0.323 Antwortzeit (Durchschnitt) 23.0s
#98	GLM 5V Turbo medium	Z.ai	7	6.7	$0.457	11/21	23.1s
Gesamttests 21 Falsche Tests 10 Gesamtkosten $0.457 Antwortzeit (Durchschnitt) 23.1s
#21	GPT-5.4 medium	OpenAI	5	8.5	$1.533	15/22	23.1s
Gesamttests 22 Falsche Tests 7 Gesamtkosten $1.533 Antwortzeit (Durchschnitt) 23.1s
#42	GLM 5.2 medium	Z.ai	3	7.8	$0.187	15/21	23.3s
Gesamttests 21 Falsche Tests 6 Gesamtkosten $0.187 Antwortzeit (Durchschnitt) 23.3s
#191	Grok 4.1 Fast medium	X AI	4	4.7	$0.069	9/19	23.8s
Gesamttests 19 Falsche Tests 10 Gesamtkosten $0.069 Antwortzeit (Durchschnitt) 23.8s
#85	KAT-Coder-Pro V2.5 medium	Kwaipilot	9	6.9	$0.467	11/22	24.0s
Gesamttests 22 Falsche Tests 11 Gesamtkosten $0.467 Antwortzeit (Durchschnitt) 24.0s
#159	Hy3 preview low	Tencent	4	5.5	$0.015	10/21	24.6s
Gesamttests 21 Falsche Tests 11 Gesamtkosten $0.015 Antwortzeit (Durchschnitt) 24.6s
#19	Muse Spark 1.1 medium	Meta	4	8.6	$1.357	15/22	25.0s
Gesamttests 22 Falsche Tests 7 Gesamtkosten $1.357 Antwortzeit (Durchschnitt) 25.0s
#131	Qwen3.5-Flash none	Qwen	13	6.1	$0.073	8/22	25.3s
Gesamttests 22 Falsche Tests 14 Gesamtkosten $0.073 Antwortzeit (Durchschnitt) 25.3s
#97	KAT-Coder-Pro V2.5 none	Kwaipilot	10	6.7	$0.476	11/22	25.6s
Gesamttests 22 Falsche Tests 11 Gesamtkosten $0.476 Antwortzeit (Durchschnitt) 25.6s
#44	Claude Sonnet 4.6 medium	Anthropic	4	7.8	$2.057	14/22	25.9s
Gesamttests 22 Falsche Tests 8 Gesamtkosten $2.057 Antwortzeit (Durchschnitt) 25.9s
#60	GPT-5.4 Mini medium	OpenAI	6	7.5	$0.756	12/22	25.9s
Gesamttests 22 Falsche Tests 10 Gesamtkosten $0.756 Antwortzeit (Durchschnitt) 25.9s

←

1 9 10 11 15

→

Falsche Antwort-Fehler

Modelle filtern

Top-Modelle nach Falsche Antwort-Anzahl

Falsche Antwort-Anzahl vs Punktzahl

Top-Modelle nach Antwortzeit (Durchschnitt)