Fehler-Ranking für Falsche Antwort

Sieh, bei welchen KI-Modellen Falsche Antwort besonders häufig auftritt, damit du Zuverlässigkeitsrisiken vor der Auswahl erkennst. Sortieren nach: Fehleranzahl ↑.

Angezeigte Modelle

Gesamtfehler

1585

Am stärksten betroffenes Modell

Gemini 3.6 Flash 1

Kategorien

In der Kategorie Domänenspezifisch421 In der Kategorie Anti-KI-Tricks293 In der Kategorie Programmierung259 In der Kategorie Rätsellösen204 In der Kategorie Allgemeinwissen172 In der Kategorie Kombiniert69 In der Kategorie Allgemeine Intelligenz62 In der Kategorie Befolgung von Anweisungen61 In der Kategorie Datenanalyse und -extraktion41 In der Kategorie Werkzeugaufrufe3

215/215

Rang	Modell	Unternehmen	Falsche Antwort-Anzahl	Punktzahl	Gesamtkosten	Korrekte Tests	Antwortzeit (Durchschnitt)
#44	Claude Sonnet 4.6 medium	Anthropic	4	7.8	$2.057	14/22	25.9s
Gesamttests 22 Falsche Tests 8 Gesamtkosten $2.057 Antwortzeit (Durchschnitt) 25.9s
#45	Claude Opus 4.8 low	Anthropic	4	7.8	$2.077	16/22	12.7s
Gesamttests 22 Falsche Tests 6 Gesamtkosten $2.077 Antwortzeit (Durchschnitt) 12.7s
#53	GLM 5 Turbo medium	Z.ai	4	7.6	$0.323	14/21	23.0s
Gesamttests 21 Falsche Tests 7 Gesamtkosten $0.323 Antwortzeit (Durchschnitt) 23.0s
#61	Qwen3.5 Plus 2026-02-15 medium	Qwen	4	7.5	$0.437	14/22	89.2s
Gesamttests 22 Falsche Tests 8 Gesamtkosten $0.437 Antwortzeit (Durchschnitt) 89.2s
#62	Qwen3.5-27B medium	Qwen	4	7.4	$1.627	13/22	111.9s
Gesamttests 22 Falsche Tests 9 Gesamtkosten $1.627 Antwortzeit (Durchschnitt) 111.9s
#70	Claude Opus 4.8 none	Anthropic	4	7.3	$1.166	13/22	4.91s
Gesamttests 22 Falsche Tests 9 Gesamtkosten $1.166 Antwortzeit (Durchschnitt) 4.91s
#78	GLM 5.1 medium	Z.ai	4	7.1	$0.535	13/22	46.8s
Gesamttests 22 Falsche Tests 9 Gesamtkosten $0.535 Antwortzeit (Durchschnitt) 46.8s
#84	Seed-2.0-Mini medium	Bytedance Seed	4	7.0	$0.101	11/22	92.5s
Gesamttests 22 Falsche Tests 11 Gesamtkosten $0.101 Antwortzeit (Durchschnitt) 92.5s
#94	Qwen3.6 35B A3B medium	Qwen	4	6.7	$0.746	13/22	58.1s
Gesamttests 22 Falsche Tests 9 Gesamtkosten $0.746 Antwortzeit (Durchschnitt) 58.1s
#120	Qwen3.5-Flash medium	Qwen	4	6.2	$0.139	12/22	84.8s
Gesamttests 22 Falsche Tests 10 Gesamtkosten $0.139 Antwortzeit (Durchschnitt) 84.8s
#136	Step 3.5 Flash medium	Stepfun	4	6.0	$0.108	11/21	174.2s
Gesamttests 21 Falsche Tests 10 Gesamtkosten $0.108 Antwortzeit (Durchschnitt) 174.2s
#149	Gemini 3.1 Flash Lite high	Google	4	5.6	$2.044	10/18	62.0s
Gesamttests 18 Falsche Tests 8 Gesamtkosten $2.044 Antwortzeit (Durchschnitt) 62.0s
#159	Hy3 preview low	Tencent	4	5.5	$0.015	10/21	24.6s
Gesamttests 21 Falsche Tests 11 Gesamtkosten $0.015 Antwortzeit (Durchschnitt) 24.6s
#187	Grok 4.20 Multi Agent Beta medium	X AI	4	4.8	$5.599	8/18	9.69s
Gesamttests 18 Falsche Tests 10 Gesamtkosten $5.599 Antwortzeit (Durchschnitt) 9.69s
#190	Hunter Alpha medium	OpenRouter	4	4.7	$0.000	8/18	10.3s
Gesamttests 18 Falsche Tests 10 Gesamtkosten $0.000 Antwortzeit (Durchschnitt) 10.3s

Falsche Antwort-Fehler

Modelle filtern

Top-Modelle nach Falsche Antwort-Anzahl

Falsche Antwort-Anzahl vs Punktzahl

Top-Modelle nach Antwortzeit (Durchschnitt)