Fehler-Ranking für Falsche Antwort

Sieh, bei welchen KI-Modellen Falsche Antwort besonders häufig auftritt, damit du Zuverlässigkeitsrisiken vor der Auswahl erkennst. Sortieren nach: Korrekte Tests ↑.

Angezeigte Modelle

Gesamtfehler

1558

Am stärksten betroffenes Modell

Granite 4.1 8B 13

Kategorien

In der Kategorie Domänenspezifisch412 In der Kategorie Anti-KI-Tricks293 In der Kategorie Programmierung252 In der Kategorie Rätsellösen201 In der Kategorie Allgemeinwissen168 In der Kategorie Kombiniert68 In der Kategorie Befolgung von Anweisungen61 In der Kategorie Allgemeine Intelligenz59 In der Kategorie Datenanalyse und -extraktion41 In der Kategorie Werkzeugaufrufe3

209/209

Rang	Modell	Unternehmen	Falsche Antwort-Anzahl	Punktzahl	Gesamtkosten	Korrekte Tests	Antwortzeit (Durchschnitt)
#201	Granite 4.1 8B none	IBM Granite	13	4.0	$0.007	2/22	1.45s
Gesamttests 22 Falsche Tests 20 Gesamtkosten $0.007 Antwortzeit (Durchschnitt) 1.45s
#208	Nemotron 3 Nano Omni 30b A3b Reasoning none	NVIDIA	9	3.2	$0.000	2/19	728ms
Gesamttests 19 Falsche Tests 17 Gesamtkosten $0.000 Antwortzeit (Durchschnitt) 728ms
#210	LFM2-24B-A2B none	Liquid	9	2.2	$0.001	2/16	782ms
Gesamttests 16 Falsche Tests 14 Gesamtkosten $0.001 Antwortzeit (Durchschnitt) 782ms
#204	Qwen3.5-9B medium	Qwen	2	3.8	$0.036	3/22	82.2s
Gesamttests 22 Falsche Tests 19 Gesamtkosten $0.036 Antwortzeit (Durchschnitt) 82.2s
#203	Grok 4.1 Fast none	X AI	13	3.8	$0.008	3/19	1.62s
Gesamttests 19 Falsche Tests 16 Gesamtkosten $0.008 Antwortzeit (Durchschnitt) 1.62s
#161	Qwen3.6 35B A3B none	Qwen	13	5.3	$0.061	4/22	5.52s
Gesamttests 22 Falsche Tests 18 Gesamtkosten $0.061 Antwortzeit (Durchschnitt) 5.52s
#162	Ling-2.6-1T none	Inclusionai	12	5.3	$0.016	4/22	8.58s
Gesamttests 22 Falsche Tests 18 Gesamtkosten $0.016 Antwortzeit (Durchschnitt) 8.58s
#169	Qwen3.5-9B none	Qwen	14	5.1	$0.021	4/22	19.2s
Gesamttests 22 Falsche Tests 18 Gesamtkosten $0.021 Antwortzeit (Durchschnitt) 19.2s
#171	North Mini Code none	Cohere	12	5.1	$0.000	4/22	29.9s
Gesamttests 22 Falsche Tests 18 Gesamtkosten $0.000 Antwortzeit (Durchschnitt) 29.9s
#180	GPT-5.4 Nano none	OpenAI	15	4.8	$0.041	4/22	2.57s
Gesamttests 22 Falsche Tests 18 Gesamtkosten $0.041 Antwortzeit (Durchschnitt) 2.57s
#187	Qwen3 Coder Next medium	Qwen	13	4.7	$0.032	4/22	9.61s
Gesamttests 22 Falsche Tests 18 Gesamtkosten $0.032 Antwortzeit (Durchschnitt) 9.61s
#189	Mercury 2 none	Inception	17	4.6	$0.030	4/22	829ms
Gesamttests 22 Falsche Tests 18 Gesamtkosten $0.030 Antwortzeit (Durchschnitt) 829ms
#194	GLM 4.7 Flash medium	Z.ai	9	4.3	$0.166	4/22	142.6s
Gesamttests 22 Falsche Tests 18 Gesamtkosten $0.166 Antwortzeit (Durchschnitt) 142.6s
#183	Trinity Large Preview none	Arcee AI	12	4.8	$0.008	4/21	2.98s
Gesamttests 21 Falsche Tests 17 Gesamtkosten $0.008 Antwortzeit (Durchschnitt) 2.98s
#199	Hy3 preview none	Tencent	8	4.0	$0.003	4/21	12.9s
Gesamttests 21 Falsche Tests 17 Gesamtkosten $0.003 Antwortzeit (Durchschnitt) 12.9s

Falsche Antwort-Fehler

Modelle filtern

Top-Modelle nach Falsche Antwort-Anzahl

Falsche Antwort-Anzahl vs Punktzahl

Top-Modelle nach Antwortzeit (Durchschnitt)