Fehler-Ranking für API-Fehler

Sieh, bei welchen KI-Modellen API-Fehler besonders häufig auftritt, damit du Zuverlässigkeitsrisiken vor der Auswahl erkennst. Sortieren nach: Antwortzeit (Durchschnitt) ↓.

Angezeigte Modelle

Gesamtfehler

161

Am stärksten betroffenes Modell

Step 3.5 Flash 1

Kategorien

In der Kategorie Programmierung45 In der Kategorie Kombiniert26 In der Kategorie Werkzeugaufrufe17 In der Kategorie Anti-KI-Tricks14 In der Kategorie Datenanalyse und -extraktion14 In der Kategorie Allgemeinwissen13 In der Kategorie Allgemeine Intelligenz12 In der Kategorie Rätsellösen12 In der Kategorie Domänenspezifisch7 In der Kategorie Befolgung von Anweisungen1

68/68

Rang	Modell	Unternehmen	API-Fehler-Anzahl	Punktzahl	Gesamtkosten	Korrekte Tests	Antwortzeit (Durchschnitt)
#130	Step 3.5 Flash medium	Stepfun	1	6.0	$0.108	11/21	174.2s
Gesamttests 21 Falsche Tests 10 Gesamtkosten $0.108 Antwortzeit (Durchschnitt) 174.2s
#137	North Mini Code medium	Cohere	1	5.9	$0.000	9/22	137.1s
Gesamttests 22 Falsche Tests 13 Gesamtkosten $0.000 Antwortzeit (Durchschnitt) 137.1s
#60	LongCat 2.0 medium	Meituan	1	7.4	$0.478	12/22	136.6s
Gesamttests 22 Falsche Tests 10 Gesamtkosten $0.478 Antwortzeit (Durchschnitt) 136.6s
#33	Kimi K3 max	Moonshot AI	2	8.0	$3.112	16/22	122.5s
Gesamttests 22 Falsche Tests 6 Gesamtkosten $3.112 Antwortzeit (Durchschnitt) 122.5s
#119	Qwen3.5-35B-A3B medium	Qwen	1	6.2	$0.837	11/22	112.5s
Gesamttests 22 Falsche Tests 11 Gesamtkosten $0.837 Antwortzeit (Durchschnitt) 112.5s
#91	LongCat 2.0 low	Meituan	1	6.7	$0.391	10/22	100.3s
Gesamttests 22 Falsche Tests 12 Gesamtkosten $0.391 Antwortzeit (Durchschnitt) 100.3s
#57	Qwen3.5 Plus 2026-02-15 medium	Qwen	1	7.5	$0.437	14/22	89.2s
Gesamttests 22 Falsche Tests 8 Gesamtkosten $0.437 Antwortzeit (Durchschnitt) 89.2s
#114	Qwen3.5-Flash medium	Qwen	1	6.2	$0.139	12/22	84.8s
Gesamttests 22 Falsche Tests 10 Gesamtkosten $0.139 Antwortzeit (Durchschnitt) 84.8s
#52	Kimi K2.7 Code medium	Moonshot AI	1	7.5	$0.751	12/22	84.2s
Gesamttests 22 Falsche Tests 10 Gesamtkosten $0.751 Antwortzeit (Durchschnitt) 84.2s
#204	Qwen3.5-9B medium	Qwen	1	3.8	$0.036	3/22	82.2s
Gesamttests 22 Falsche Tests 19 Gesamtkosten $0.036 Antwortzeit (Durchschnitt) 82.2s
#46	DeepSeek V4 Pro high	DeepSeek	1	7.7	$0.200	10/22	79.1s
Gesamttests 22 Falsche Tests 12 Gesamtkosten $0.200 Antwortzeit (Durchschnitt) 79.1s
#110	Gemma 4 31B medium	Google	2	6.3	$0.163	14/22	75.4s
Gesamttests 22 Falsche Tests 8 Gesamtkosten $0.163 Antwortzeit (Durchschnitt) 75.4s
#108	Ring-2.6-1T medium	Inclusionai	2	6.3	$0.103	11/22	68.7s
Gesamttests 22 Falsche Tests 11 Gesamtkosten $0.103 Antwortzeit (Durchschnitt) 68.7s
#76	DeepSeek V3.2 medium	DeepSeek	2	7.0	$0.078	11/22	68.6s
Gesamttests 22 Falsche Tests 11 Gesamtkosten $0.078 Antwortzeit (Durchschnitt) 68.6s
#90	Qwen3.6 35B A3B medium	Qwen	2	6.7	$0.746	13/22	58.1s
Gesamttests 22 Falsche Tests 9 Gesamtkosten $0.746 Antwortzeit (Durchschnitt) 58.1s

1 2 3 4 5

→

API-Fehler-Fehler

Modelle filtern

Top-Modelle nach API-Fehler-Anzahl

API-Fehler-Anzahl vs Punktzahl

Top-Modelle nach Antwortzeit (Durchschnitt)