Fehler-Ranking für Falsche Antwort

Sieh, bei welchen KI-Modellen Falsche Antwort besonders häufig auftritt, damit du Zuverlässigkeitsrisiken vor der Auswahl erkennst. Sortieren nach: Punktzahl ↓.

Angezeigte Modelle

Gesamtfehler

1585

Am stärksten betroffenes Modell

Gemini 3.6 Flash 1

Kategorien

In der Kategorie Domänenspezifisch421 In der Kategorie Anti-KI-Tricks293 In der Kategorie Programmierung259 In der Kategorie Rätsellösen204 In der Kategorie Allgemeinwissen172 In der Kategorie Kombiniert69 In der Kategorie Allgemeine Intelligenz62 In der Kategorie Befolgung von Anweisungen61 In der Kategorie Datenanalyse und -extraktion41 In der Kategorie Werkzeugaufrufe3

215/215

Rang	Modell	Unternehmen	Falsche Antwort-Anzahl	Punktzahl	Gesamtkosten	Korrekte Tests	Antwortzeit (Durchschnitt)
#62	Qwen3.5-27B medium	Qwen	4	7.4	$1.627	13/22	111.9s
Gesamttests 22 Falsche Tests 9 Gesamtkosten $1.627 Antwortzeit (Durchschnitt) 111.9s
#63	Qwen3.7 Max none	Qwen	7	7.4	$0.197	15/22	4.52s
Gesamttests 22 Falsche Tests 7 Gesamtkosten $0.197 Antwortzeit (Durchschnitt) 4.52s
#64	LongCat 2.0 medium	Meituan	7	7.4	$0.478	12/22	136.6s
Gesamttests 22 Falsche Tests 10 Gesamtkosten $0.478 Antwortzeit (Durchschnitt) 136.6s
#65	Gemini 3 Flash Preview low	Google	6	7.4	$0.177	16/22	6.28s
Gesamttests 22 Falsche Tests 6 Gesamtkosten $0.177 Antwortzeit (Durchschnitt) 6.28s
#66	KAT-Coder-Pro V2.5 low	Kwaipilot	10	7.4	$0.387	11/22	19.5s
Gesamttests 22 Falsche Tests 11 Gesamtkosten $0.387 Antwortzeit (Durchschnitt) 19.5s
#67	Claude Sonnet 4.6 none	Anthropic	5	7.3	$0.661	12/22	8.12s
Gesamttests 22 Falsche Tests 10 Gesamtkosten $0.661 Antwortzeit (Durchschnitt) 8.12s
#68	Gemini 3.1 Flash Lite Preview medium	Google	7	7.3	$0.115	13/22	4.61s
Gesamttests 22 Falsche Tests 9 Gesamtkosten $0.115 Antwortzeit (Durchschnitt) 4.61s
#69	Gemini 3.1 Flash Lite medium	Google	7	7.3	$0.117	13/22	4.27s
Gesamttests 22 Falsche Tests 9 Gesamtkosten $0.117 Antwortzeit (Durchschnitt) 4.27s
#70	Claude Opus 4.8 none	Anthropic	4	7.3	$1.166	13/22	4.91s
Gesamttests 22 Falsche Tests 9 Gesamtkosten $1.166 Antwortzeit (Durchschnitt) 4.91s
#71	Step 3.7 Flash low	Stepfun	8	7.3	$0.454	12/22	20.7s
Gesamttests 22 Falsche Tests 10 Gesamtkosten $0.454 Antwortzeit (Durchschnitt) 20.7s
#72	Kimi K2.6 medium	Moonshot AI	3	7.2	$1.036	12/22	110.0s
Gesamttests 22 Falsche Tests 10 Gesamtkosten $1.036 Antwortzeit (Durchschnitt) 110.0s
#73	KAT-Coder-Pro V2.5 high	Kwaipilot	10	7.2	$0.482	11/22	20.8s
Gesamttests 22 Falsche Tests 11 Gesamtkosten $0.482 Antwortzeit (Durchschnitt) 20.8s
#74	Qwen3.5 Plus 2026-04-20 medium	Qwen	8	7.2	$0.317	13/22	46.4s
Gesamttests 22 Falsche Tests 9 Gesamtkosten $0.317 Antwortzeit (Durchschnitt) 46.4s
#75	Qwen3.7 Plus none	Qwen	10	7.2	$0.106	11/22	12.1s
Gesamttests 22 Falsche Tests 11 Gesamtkosten $0.106 Antwortzeit (Durchschnitt) 12.1s
#76	Qwen3.5-122B-A10B medium	Qwen	5	7.1	$1.046	14/22	64.2s
Gesamttests 22 Falsche Tests 8 Gesamtkosten $1.046 Antwortzeit (Durchschnitt) 64.2s

Falsche Antwort-Fehler

Modelle filtern

Top-Modelle nach Falsche Antwort-Anzahl

Falsche Antwort-Anzahl vs Punktzahl

Top-Modelle nach Antwortzeit (Durchschnitt)