Fehler-Ranking für Falsche Antwort

Sieh, bei welchen KI-Modellen Falsche Antwort besonders häufig auftritt, damit du Zuverlässigkeitsrisiken vor der Auswahl erkennst. Sortieren nach: Punktzahl ↓.

Angezeigte Modelle

Gesamtfehler

1585

Am stärksten betroffenes Modell

Gemini 3.6 Flash 1

Kategorien

In der Kategorie Domänenspezifisch421 In der Kategorie Anti-KI-Tricks293 In der Kategorie Programmierung259 In der Kategorie Rätsellösen204 In der Kategorie Allgemeinwissen172 In der Kategorie Kombiniert69 In der Kategorie Allgemeine Intelligenz62 In der Kategorie Befolgung von Anweisungen61 In der Kategorie Datenanalyse und -extraktion41 In der Kategorie Werkzeugaufrufe3

215/215

Rang	Modell	Unternehmen	Falsche Antwort-Anzahl	Punktzahl	Gesamtkosten	Korrekte Tests	Antwortzeit (Durchschnitt)
#77	Grok 4.3 medium	X AI	5	7.1	$0.779	13/22	47.4s
Gesamttests 22 Falsche Tests 9 Gesamtkosten $0.779 Antwortzeit (Durchschnitt) 47.4s
#78	GLM 5.1 medium	Z.ai	4	7.1	$0.535	13/22	46.8s
Gesamttests 22 Falsche Tests 9 Gesamtkosten $0.535 Antwortzeit (Durchschnitt) 46.8s
#79	Grok 4.20 medium	X AI	6	7.1	$0.777	12/22	29.5s
Gesamttests 22 Falsche Tests 10 Gesamtkosten $0.777 Antwortzeit (Durchschnitt) 29.5s
#80	DeepSeek V3.2 medium	DeepSeek	5	7.0	$0.078	11/22	68.6s
Gesamttests 22 Falsche Tests 11 Gesamtkosten $0.078 Antwortzeit (Durchschnitt) 68.6s
#81	Kimi K2.5 medium	Moonshot AI	5	7.0	$0.600	10/22	99.0s
Gesamttests 22 Falsche Tests 12 Gesamtkosten $0.600 Antwortzeit (Durchschnitt) 99.0s
#82	Mercury 2 medium	Inception	8	7.0	$0.093	10/22	2.72s
Gesamttests 22 Falsche Tests 12 Gesamtkosten $0.093 Antwortzeit (Durchschnitt) 2.72s
#83	Gemini 3.5 Flash none	Google	3	7.0	$1.079	15/22	9.93s
Gesamttests 22 Falsche Tests 7 Gesamtkosten $1.079 Antwortzeit (Durchschnitt) 9.93s
#84	Seed-2.0-Mini medium	Bytedance Seed	4	7.0	$0.101	11/22	92.5s
Gesamttests 22 Falsche Tests 11 Gesamtkosten $0.101 Antwortzeit (Durchschnitt) 92.5s
#85	KAT-Coder-Pro V2.5 medium	Kwaipilot	9	6.9	$0.467	11/22	24.0s
Gesamttests 22 Falsche Tests 11 Gesamtkosten $0.467 Antwortzeit (Durchschnitt) 24.0s
#86	DeepSeek V4 Pro none	DeepSeek	8	6.9	$0.096	10/22	11.6s
Gesamttests 22 Falsche Tests 12 Gesamtkosten $0.096 Antwortzeit (Durchschnitt) 11.6s
#87	GPT-5.6 Sol none	OpenAI	10	6.9	$0.524	11/22	2.16s
Gesamttests 22 Falsche Tests 11 Gesamtkosten $0.524 Antwortzeit (Durchschnitt) 2.16s
#88	MiMo-V2.5-Pro medium	Xiaomi	3	6.9	$0.187	12/22	33.9s
Gesamttests 22 Falsche Tests 10 Gesamtkosten $0.187 Antwortzeit (Durchschnitt) 33.9s
#89	Qwen3.6 Flash medium	Qwen	8	6.9	$0.738	12/22	44.7s
Gesamttests 22 Falsche Tests 10 Gesamtkosten $0.738 Antwortzeit (Durchschnitt) 44.7s
#90	Step 3.7 Flash high	Stepfun	6	6.9	$1.207	11/22	64.7s
Gesamttests 22 Falsche Tests 11 Gesamtkosten $1.207 Antwortzeit (Durchschnitt) 64.7s
#91	GPT-5.5 none	OpenAI	11	6.9	$0.544	11/22	2.36s
Gesamttests 22 Falsche Tests 11 Gesamtkosten $0.544 Antwortzeit (Durchschnitt) 2.36s

Falsche Antwort-Fehler

Modelle filtern

Top-Modelle nach Falsche Antwort-Anzahl

Falsche Antwort-Anzahl vs Punktzahl

Top-Modelle nach Antwortzeit (Durchschnitt)