Fehler-Ranking für API-Fehler

Sieh, bei welchen KI-Modellen API-Fehler besonders häufig auftritt, damit du Zuverlässigkeitsrisiken vor der Auswahl erkennst. Sortieren nach: Fehleranzahl ↑.

Angezeigte Modelle

Gesamtfehler

161

Am stärksten betroffenes Modell

Muse Spark 1.1 1

Kategorien

In der Kategorie Programmierung45 In der Kategorie Kombiniert26 In der Kategorie Werkzeugaufrufe17 In der Kategorie Anti-KI-Tricks14 In der Kategorie Datenanalyse und -extraktion14 In der Kategorie Allgemeinwissen13 In der Kategorie Allgemeine Intelligenz12 In der Kategorie Rätsellösen12 In der Kategorie Domänenspezifisch7 In der Kategorie Befolgung von Anweisungen1

68/68

Rang	Modell	Unternehmen	API-Fehler-Anzahl	Punktzahl	Gesamtkosten	Korrekte Tests	Antwortzeit (Durchschnitt)
#144	KAT-Coder-Air V2.5 high	Kwaipilot	3	5.6	$0.077	7/22	15.9s
Gesamttests 22 Falsche Tests 15 Gesamtkosten $0.077 Antwortzeit (Durchschnitt) 15.9s
#162	Ling-2.6-1T none	Inclusionai	3	5.3	$0.016	4/22	8.58s
Gesamttests 22 Falsche Tests 18 Gesamtkosten $0.016 Antwortzeit (Durchschnitt) 8.58s
#193	Elephant Alpha none	Openrouter	3	4.3	$0.000	5/21	1.22s
Gesamttests 21 Falsche Tests 16 Gesamtkosten $0.000 Antwortzeit (Durchschnitt) 1.22s
#195	Elephant Alpha medium	Openrouter	3	4.3	$0.000	6/21	1.27s
Gesamttests 21 Falsche Tests 15 Gesamtkosten $0.000 Antwortzeit (Durchschnitt) 1.27s
#202	Grok Build 0.1 none	X AI	3	4.0	$0.547	7/19	28.7s
Gesamttests 19 Falsche Tests 12 Gesamtkosten $0.547 Antwortzeit (Durchschnitt) 28.7s
#206	gpt-oss-120b none	OpenAI	3	3.7	$0.010	6/19	21.6s
Gesamttests 19 Falsche Tests 13 Gesamtkosten $0.010 Antwortzeit (Durchschnitt) 21.6s
#79	Gemini 3.5 Flash none	Google	4	7.0	$1.079	15/22	9.93s
Gesamttests 22 Falsche Tests 7 Gesamtkosten $1.079 Antwortzeit (Durchschnitt) 9.93s
#133	Gemini 3 PRO Preview medium	Google	4	6.0	$0.385	14/21	9.05s
Gesamttests 21 Falsche Tests 7 Gesamtkosten $0.385 Antwortzeit (Durchschnitt) 9.05s
#140	Nemotron 3 Super medium	NVIDIA	4	5.7	$0.050	8/22	52.0s
Gesamttests 22 Falsche Tests 14 Gesamtkosten $0.050 Antwortzeit (Durchschnitt) 52.0s
#173	DeepSeek V3.2 none	DeepSeek	4	5.0	$0.054	6/22	18.3s
Gesamttests 22 Falsche Tests 16 Gesamtkosten $0.054 Antwortzeit (Durchschnitt) 18.3s
#186	Laguna M.1 medium	Poolside	4	4.7	$0.033	9/19	14.7s
Gesamttests 19 Falsche Tests 10 Gesamtkosten $0.033 Antwortzeit (Durchschnitt) 14.7s
#192	Laguna M.1 none	Poolside	4	4.4	$0.009	4/19	2.89s
Gesamttests 19 Falsche Tests 15 Gesamtkosten $0.009 Antwortzeit (Durchschnitt) 2.89s
#198	Laguna Xs.2 medium	Poolside	4	4.1	$0.015	6/19	6.73s
Gesamttests 19 Falsche Tests 13 Gesamtkosten $0.015 Antwortzeit (Durchschnitt) 6.73s
#199	Hy3 preview none	Tencent	4	4.0	$0.003	4/21	12.9s
Gesamttests 21 Falsche Tests 17 Gesamtkosten $0.003 Antwortzeit (Durchschnitt) 12.9s
#205	Laguna Xs.2 none	Poolside	4	3.8	$0.004	5/19	806ms
Gesamttests 19 Falsche Tests 14 Gesamtkosten $0.004 Antwortzeit (Durchschnitt) 806ms

←

1 2 3 4 5

→

API-Fehler-Fehler

Modelle filtern

Top-Modelle nach API-Fehler-Anzahl

API-Fehler-Anzahl vs Punktzahl

Top-Modelle nach Antwortzeit (Durchschnitt)