Fehler-Ranking für Falsche Antwort

Sieh, bei welchen KI-Modellen Falsche Antwort besonders häufig auftritt, damit du Zuverlässigkeitsrisiken vor der Auswahl erkennst. Sortieren nach: Korrekte Tests ↓.

Angezeigte Modelle

Gesamtfehler

1558

Am stärksten betroffenes Modell

Gemini 3 Flash Preview 1

Kategorien

In der Kategorie Domänenspezifisch412 In der Kategorie Anti-KI-Tricks293 In der Kategorie Programmierung252 In der Kategorie Rätsellösen201 In der Kategorie Allgemeinwissen168 In der Kategorie Kombiniert68 In der Kategorie Befolgung von Anweisungen61 In der Kategorie Allgemeine Intelligenz59 In der Kategorie Datenanalyse und -extraktion41 In der Kategorie Werkzeugaufrufe3

209/209

Rang	Modell	Unternehmen	Falsche Antwort-Anzahl	Punktzahl	Gesamtkosten	Korrekte Tests	Antwortzeit (Durchschnitt)
#28	Inkling high	Thinkingmachines	4	8.0	$1.006	15/22	64.2s
Gesamttests 22 Falsche Tests 7 Gesamtkosten $1.006 Antwortzeit (Durchschnitt) 64.2s
#32	Inkling medium	Thinkingmachines	4	8.0	$0.391	15/22	16.2s
Gesamttests 22 Falsche Tests 7 Gesamtkosten $0.391 Antwortzeit (Durchschnitt) 16.2s
#36	Qwen3.7 Plus medium	Qwen	5	7.9	$0.267	15/22	51.5s
Gesamttests 22 Falsche Tests 7 Gesamtkosten $0.267 Antwortzeit (Durchschnitt) 51.5s
#37	Qwen3.6 Plus medium	Qwen	5	7.8	$0.405	15/22	43.1s
Gesamttests 22 Falsche Tests 7 Gesamtkosten $0.405 Antwortzeit (Durchschnitt) 43.1s
#44	GPT-5.6 Luna high	OpenAI	7	7.7	$1.017	15/22	18.7s
Gesamttests 22 Falsche Tests 7 Gesamtkosten $1.017 Antwortzeit (Durchschnitt) 18.7s
#59	Qwen3.7 Max none	Qwen	7	7.4	$0.197	15/22	4.52s
Gesamttests 22 Falsche Tests 7 Gesamtkosten $0.197 Antwortzeit (Durchschnitt) 4.52s
#79	Gemini 3.5 Flash none	Google	3	7.0	$1.079	15/22	9.93s
Gesamttests 22 Falsche Tests 7 Gesamtkosten $1.079 Antwortzeit (Durchschnitt) 9.93s
#49	GLM 5 Turbo medium	Z.ai	4	7.6	$0.323	14/21	23.0s
Gesamttests 21 Falsche Tests 7 Gesamtkosten $0.323 Antwortzeit (Durchschnitt) 23.0s
#100	Hy3 preview medium	Tencent	3	6.5	$0.018	14/21	16.3s
Gesamttests 21 Falsche Tests 7 Gesamtkosten $0.018 Antwortzeit (Durchschnitt) 16.3s
#133	Gemini 3 PRO Preview medium	Google	3	6.0	$0.385	14/21	9.05s
Gesamttests 21 Falsche Tests 7 Gesamtkosten $0.385 Antwortzeit (Durchschnitt) 9.05s
#21	GPT-5.2 medium	OpenAI	3	8.4	$0.951	14/22	22.6s
Gesamttests 22 Falsche Tests 8 Gesamtkosten $0.951 Antwortzeit (Durchschnitt) 22.6s
#29	Step 3.7 Flash medium	Stepfun	5	8.0	$0.515	14/22	26.4s
Gesamttests 22 Falsche Tests 8 Gesamtkosten $0.515 Antwortzeit (Durchschnitt) 26.4s
#30	GPT-5.2 Chat none	OpenAI	6	8.0	$0.604	14/22	7.65s
Gesamttests 22 Falsche Tests 8 Gesamtkosten $0.604 Antwortzeit (Durchschnitt) 7.65s
#31	GLM 5.2 high	Z.ai	3	8.0	$0.970	14/22	62.7s
Gesamttests 22 Falsche Tests 8 Gesamtkosten $0.970 Antwortzeit (Durchschnitt) 62.7s
#34	GPT-5.6 Terra high	OpenAI	7	8.0	$1.055	14/22	11.3s
Gesamttests 22 Falsche Tests 8 Gesamtkosten $1.055 Antwortzeit (Durchschnitt) 11.3s

Falsche Antwort-Fehler

Modelle filtern

Top-Modelle nach Falsche Antwort-Anzahl

Falsche Antwort-Anzahl vs Punktzahl

Top-Modelle nach Antwortzeit (Durchschnitt)