Modell-Ranking für Werkzeugaufrufe

AI BENCHY Kategorie

Sieh, welche KI-Modelle bei Werkzeugaufrufe am besten abschneiden, welche zuverlässig bleiben und wo die größten Unterschiede liegen. Sortieren nach: Korrekte Tests ↑.

Angezeigte Modelle

Durchschnittlicher Wert für Werkzeugaufrufe-Score

8.7

Bestes Modell

Grok 4.20 Beta 3.0

Fehlergründe

Mit Fehlergrund API-Fehler15 Mit Fehlergrund Ungültiger Werkzeugaufruf7 Mit Fehlergrund Anweisungen nicht befolgt6 Mit Fehlergrund Falsche Antwort2 Mit Fehlergrund Keine Antwort2

Rang	Modell	Unternehmen	Werkzeugaufrufe-Score	Punktzahl	Korrekte Tests	Antwortzeit (Durchschnitt)
#50	Gemini 3.1 Flash Lite Preview low	Google	10.0	7.4	1/1	9.54s
#51	Mimo V2 PRO medium	Xiaomi	10.0	7.4	1/1	8.19s
#52	Claude Sonnet 4.6 medium	Anthropic	10.0	7.4	1/1	7.48s
#53	Gemini 3.1 Flash Lite high	Google	10.0	7.3	1/1	6.44s
#54	GPT-5 Mini medium	OpenAI	10.0	7.3	1/1	18.6s
#56	MiMo-V2.5 medium	Xiaomi	10.0	7.3	1/1	7.29s
#57	Step 3.7 Flash low	Stepfun	10.0	7.3	1/1	3.25s
#58	Gemini 3.1 Flash Lite Preview none	Google	10.0	7.2	1/1	3.39s
#60	Kimi K2.6 medium	Moonshot AI	10.0	7.2	1/1	8.92s
#61	Gemini 3.1 Flash Lite low	Google	10.0	7.2	1/1	5.66s
#62	Step 3.5 Flash medium	Stepfun	10.0	7.2	1/1	11.9s
#63	GPT-5.3 Chat none	OpenAI	10.0	7.2	1/1	8.36s
#64	MiMo-V2-Flash medium	Xiaomi	10.0	7.2	1/1	27.8s
#66	Qwen3.5-35B-A3B medium	Qwen	10.0	7.1	1/1	4.65s
#67	MiniMax M3 medium	Minimax	10.0	7.1	1/1	11.9s

Werkzeugaufrufe-Ranking

Top-Modelle nach Werkzeugaufrufe-Score

Werkzeugaufrufe-Score vs. Gesamtkosten

Top-Modelle nach Antwortzeit (Durchschnitt)