Fehler-Ranking für Falsche Antwort

Sieh, bei welchen KI-Modellen Falsche Antwort besonders häufig auftritt, damit du Zuverlässigkeitsrisiken vor der Auswahl erkennst. Sortieren nach: Punktzahl ↓.

Angezeigte Modelle

Gesamtfehler

1585

Am stärksten betroffenes Modell

Gemini 3.6 Flash 1

Kategorien

In der Kategorie Domänenspezifisch421 In der Kategorie Anti-KI-Tricks293 In der Kategorie Programmierung259 In der Kategorie Rätsellösen204 In der Kategorie Allgemeinwissen172 In der Kategorie Kombiniert69 In der Kategorie Allgemeine Intelligenz62 In der Kategorie Befolgung von Anweisungen61 In der Kategorie Datenanalyse und -extraktion41 In der Kategorie Werkzeugaufrufe3

215/215

Rang	Modell	Unternehmen	Falsche Antwort-Anzahl	Punktzahl	Gesamtkosten	Korrekte Tests	Antwortzeit (Durchschnitt)
#92	Gemini 3.5 Flash minimal	Google	5	6.8	$0.300	14/22	2.65s
Gesamttests 22 Falsche Tests 8 Gesamtkosten $0.300 Antwortzeit (Durchschnitt) 2.65s
#93	Gemini 3 Flash Preview none	Google	8	6.8	$0.085	13/22	2.95s
Gesamttests 22 Falsche Tests 9 Gesamtkosten $0.085 Antwortzeit (Durchschnitt) 2.95s
#94	Qwen3.6 35B A3B medium	Qwen	4	6.7	$0.746	13/22	58.1s
Gesamttests 22 Falsche Tests 9 Gesamtkosten $0.746 Antwortzeit (Durchschnitt) 58.1s
#95	Gemini 3.5 Flash-Lite low	Google	9	6.7	$0.145	12/22	2.25s
Gesamttests 22 Falsche Tests 10 Gesamtkosten $0.145 Antwortzeit (Durchschnitt) 2.25s
#96	LongCat 2.0 low	Meituan	8	6.7	$0.391	10/22	100.3s
Gesamttests 22 Falsche Tests 12 Gesamtkosten $0.391 Antwortzeit (Durchschnitt) 100.3s
#97	KAT-Coder-Pro V2.5 none	Kwaipilot	10	6.7	$0.476	11/22	25.6s
Gesamttests 22 Falsche Tests 11 Gesamtkosten $0.476 Antwortzeit (Durchschnitt) 25.6s
#98	GLM 5V Turbo medium	Z.ai	7	6.7	$0.457	11/21	23.1s
Gesamttests 21 Falsche Tests 10 Gesamtkosten $0.457 Antwortzeit (Durchschnitt) 23.1s
#99	Claude Opus 4.7 none	Anthropic	3	6.6	$0.505	16/19	3.02s
Gesamttests 19 Falsche Tests 3 Gesamtkosten $0.505 Antwortzeit (Durchschnitt) 3.02s
#100	Gemma 4 26B A4B medium	Google	3	6.6	$0.089	14/22	103.8s
Gesamttests 22 Falsche Tests 8 Gesamtkosten $0.089 Antwortzeit (Durchschnitt) 103.8s
#101	GLM 5.2 none	Z.ai	8	6.6	$0.128	12/22	9.34s
Gesamttests 22 Falsche Tests 10 Gesamtkosten $0.128 Antwortzeit (Durchschnitt) 9.34s
#102	LongCat 2.0 high	Meituan	6	6.6	$0.469	9/22	148.7s
Gesamttests 22 Falsche Tests 13 Gesamtkosten $0.469 Antwortzeit (Durchschnitt) 148.7s
#103	Qwen3.6 Max Preview none	Qwen	10	6.6	$0.231	12/22	7.82s
Gesamttests 22 Falsche Tests 10 Gesamtkosten $0.231 Antwortzeit (Durchschnitt) 7.82s
#104	Gemini 3.5 Flash-Lite medium	Google	9	6.5	$0.369	12/22	6.01s
Gesamttests 22 Falsche Tests 10 Gesamtkosten $0.369 Antwortzeit (Durchschnitt) 6.01s
#105	Qwen3.6 27B medium	Qwen	6	6.5	$0.779	10/22	106.3s
Gesamttests 22 Falsche Tests 12 Gesamtkosten $0.779 Antwortzeit (Durchschnitt) 106.3s
#106	Hy3 preview medium	Tencent	3	6.5	$0.018	14/21	16.3s
Gesamttests 21 Falsche Tests 7 Gesamtkosten $0.018 Antwortzeit (Durchschnitt) 16.3s

Falsche Antwort-Fehler

Modelle filtern

Top-Modelle nach Falsche Antwort-Anzahl

Falsche Antwort-Anzahl vs Punktzahl

Top-Modelle nach Antwortzeit (Durchschnitt)