Fehler-Ranking für Falsche Antwort

Sieh, bei welchen KI-Modellen Falsche Antwort besonders häufig auftritt, damit du Zuverlässigkeitsrisiken vor der Auswahl erkennst. Sortieren nach: Antwortzeit (Durchschnitt) ↑.

Angezeigte Modelle

Gesamtfehler

1558

Am stärksten betroffenes Modell

Nemotron 3 Nano Omni 30b A3b Reasoning 9

Kategorien

In der Kategorie Domänenspezifisch412 In der Kategorie Anti-KI-Tricks293 In der Kategorie Programmierung252 In der Kategorie Rätsellösen201 In der Kategorie Allgemeinwissen168 In der Kategorie Kombiniert68 In der Kategorie Befolgung von Anweisungen61 In der Kategorie Allgemeine Intelligenz59 In der Kategorie Datenanalyse und -extraktion41 In der Kategorie Werkzeugaufrufe3

209/209

Rang	Modell	Unternehmen	Falsche Antwort-Anzahl	Punktzahl	Gesamtkosten	Korrekte Tests	Antwortzeit (Durchschnitt)
#132	GPT-5.6 Terra none	OpenAI	11	6.0	$0.349	8/22	1.65s
Gesamttests 22 Falsche Tests 14 Gesamtkosten $0.349 Antwortzeit (Durchschnitt) 1.65s
#122	Gemini 3.1 Flash Lite none	Google	11	6.1	$0.046	9/22	1.75s
Gesamttests 22 Falsche Tests 13 Gesamtkosten $0.046 Antwortzeit (Durchschnitt) 1.75s
#120	Gemini 3.1 Flash Lite minimal	Google	8	6.1	$0.047	10/22	1.86s
Gesamttests 22 Falsche Tests 12 Gesamtkosten $0.047 Antwortzeit (Durchschnitt) 1.86s
#174	GPT-4o-mini none	OpenAI	15	5.0	$0.010	5/22	1.99s
Gesamttests 22 Falsche Tests 17 Gesamtkosten $0.010 Antwortzeit (Durchschnitt) 1.99s
#139	GPT-5.4 none	OpenAI	14	5.8	$0.397	7/22	2.07s
Gesamttests 22 Falsche Tests 15 Gesamtkosten $0.397 Antwortzeit (Durchschnitt) 2.07s
#83	GPT-5.6 Sol none	OpenAI	10	6.9	$0.524	11/22	2.16s
Gesamttests 22 Falsche Tests 11 Gesamtkosten $0.524 Antwortzeit (Durchschnitt) 2.16s
#147	Mimo V2 PRO none	Xiaomi	11	5.6	$0.045	7/21	2.27s
Gesamttests 21 Falsche Tests 14 Gesamtkosten $0.045 Antwortzeit (Durchschnitt) 2.27s
#87	GPT-5.5 none	OpenAI	11	6.9	$0.544	11/22	2.36s
Gesamttests 22 Falsche Tests 11 Gesamtkosten $0.544 Antwortzeit (Durchschnitt) 2.36s
#157	Mimo V2 Omni none	Xiaomi	10	5.5	$0.021	8/21	2.44s
Gesamttests 21 Falsche Tests 13 Gesamtkosten $0.021 Antwortzeit (Durchschnitt) 2.44s
#180	GPT-5.4 Nano none	OpenAI	15	4.8	$0.041	4/22	2.57s
Gesamttests 22 Falsche Tests 18 Gesamtkosten $0.041 Antwortzeit (Durchschnitt) 2.57s
#88	Gemini 3.5 Flash minimal	Google	5	6.8	$0.300	14/22	2.65s
Gesamttests 22 Falsche Tests 8 Gesamtkosten $0.300 Antwortzeit (Durchschnitt) 2.65s
#78	Mercury 2 medium	Inception	8	7.0	$0.093	10/22	2.72s
Gesamttests 22 Falsche Tests 12 Gesamtkosten $0.093 Antwortzeit (Durchschnitt) 2.72s
#200	MiMo-V2-Flash none	Xiaomi	13	4.0	$0.025	4/21	2.76s
Gesamttests 21 Falsche Tests 17 Gesamtkosten $0.025 Antwortzeit (Durchschnitt) 2.76s
#170	GLM 5 Turbo none	Z.ai	13	5.1	$0.047	6/21	2.82s
Gesamttests 21 Falsche Tests 15 Gesamtkosten $0.047 Antwortzeit (Durchschnitt) 2.82s
#192	Laguna M.1 none	Poolside	10	4.4	$0.009	4/19	2.89s
Gesamttests 19 Falsche Tests 15 Gesamtkosten $0.009 Antwortzeit (Durchschnitt) 2.89s

Falsche Antwort-Fehler

Modelle filtern

Top-Modelle nach Falsche Antwort-Anzahl

Falsche Antwort-Anzahl vs Punktzahl

Top-Modelle nach Antwortzeit (Durchschnitt)