Fehler-Ranking für Falsche Antwort

Sieh, bei welchen KI-Modellen Falsche Antwort besonders häufig auftritt, damit du Zuverlässigkeitsrisiken vor der Auswahl erkennst. Sortieren nach: Punktzahl ↑.

Angezeigte Modelle

Gesamtfehler

1585

Am stärksten betroffenes Modell

LFM2-24B-A2B 9

Kategorien

In der Kategorie Domänenspezifisch421 In der Kategorie Anti-KI-Tricks293 In der Kategorie Programmierung259 In der Kategorie Rätsellösen204 In der Kategorie Allgemeinwissen172 In der Kategorie Kombiniert69 In der Kategorie Allgemeine Intelligenz62 In der Kategorie Befolgung von Anweisungen61 In der Kategorie Datenanalyse und -extraktion41 In der Kategorie Werkzeugaufrufe3

215/215

Rang	Modell	Unternehmen	Falsche Antwort-Anzahl	Punktzahl	Gesamtkosten	Korrekte Tests	Antwortzeit (Durchschnitt)
#111	Gemini 3.1 Flash Lite low	Google	9	6.5	$0.621	12/22	16.3s
Gesamttests 22 Falsche Tests 10 Gesamtkosten $0.621 Antwortzeit (Durchschnitt) 16.3s
#110	Gemini 3.1 Flash Lite Preview low	Google	7	6.5	$0.646	13/22	16.7s
Gesamttests 22 Falsche Tests 9 Gesamtkosten $0.646 Antwortzeit (Durchschnitt) 16.7s
#108	Laguna XS 2.1 medium	Poolside	11	6.5	$0.068	9/22	47.9s
Gesamttests 22 Falsche Tests 13 Gesamtkosten $0.068 Antwortzeit (Durchschnitt) 47.9s
#109	Qwen3.5-27B none	Qwen	12	6.5	$0.090	8/22	4.76s
Gesamttests 22 Falsche Tests 14 Gesamtkosten $0.090 Antwortzeit (Durchschnitt) 4.76s
#107	MiMo-V2.5 medium	Xiaomi	5	6.5	$0.082	12/22	32.2s
Gesamttests 22 Falsche Tests 10 Gesamtkosten $0.082 Antwortzeit (Durchschnitt) 32.2s
#106	Hy3 preview medium	Tencent	3	6.5	$0.018	14/21	16.3s
Gesamttests 21 Falsche Tests 7 Gesamtkosten $0.018 Antwortzeit (Durchschnitt) 16.3s
#105	Qwen3.6 27B medium	Qwen	6	6.5	$0.779	10/22	106.3s
Gesamttests 22 Falsche Tests 12 Gesamtkosten $0.779 Antwortzeit (Durchschnitt) 106.3s
#104	Gemini 3.5 Flash-Lite medium	Google	9	6.5	$0.369	12/22	6.01s
Gesamttests 22 Falsche Tests 10 Gesamtkosten $0.369 Antwortzeit (Durchschnitt) 6.01s
#103	Qwen3.6 Max Preview none	Qwen	10	6.6	$0.231	12/22	7.82s
Gesamttests 22 Falsche Tests 10 Gesamtkosten $0.231 Antwortzeit (Durchschnitt) 7.82s
#102	LongCat 2.0 high	Meituan	6	6.6	$0.469	9/22	148.7s
Gesamttests 22 Falsche Tests 13 Gesamtkosten $0.469 Antwortzeit (Durchschnitt) 148.7s
#101	GLM 5.2 none	Z.ai	8	6.6	$0.128	12/22	9.34s
Gesamttests 22 Falsche Tests 10 Gesamtkosten $0.128 Antwortzeit (Durchschnitt) 9.34s
#100	Gemma 4 26B A4B medium	Google	3	6.6	$0.089	14/22	103.8s
Gesamttests 22 Falsche Tests 8 Gesamtkosten $0.089 Antwortzeit (Durchschnitt) 103.8s
#99	Claude Opus 4.7 none	Anthropic	3	6.6	$0.505	16/19	3.02s
Gesamttests 19 Falsche Tests 3 Gesamtkosten $0.505 Antwortzeit (Durchschnitt) 3.02s
#98	GLM 5V Turbo medium	Z.ai	7	6.7	$0.457	11/21	23.1s
Gesamttests 21 Falsche Tests 10 Gesamtkosten $0.457 Antwortzeit (Durchschnitt) 23.1s
#97	KAT-Coder-Pro V2.5 none	Kwaipilot	10	6.7	$0.476	11/22	25.6s
Gesamttests 22 Falsche Tests 11 Gesamtkosten $0.476 Antwortzeit (Durchschnitt) 25.6s

Falsche Antwort-Fehler

Modelle filtern

Top-Modelle nach Falsche Antwort-Anzahl

Falsche Antwort-Anzahl vs Punktzahl

Top-Modelle nach Antwortzeit (Durchschnitt)