Modell-Ranking für Werkzeugaufrufe

AI BENCHY Kategorie

Sieh, welche KI-Modelle bei Werkzeugaufrufe am besten abschneiden, welche zuverlässig bleiben und wo die größten Unterschiede liegen.

Angezeigte Modelle

Durchschnittlicher Wert für Werkzeugaufrufe-Score

8.7

Bestes Modell

Fehlergründe

Mit Fehlergrund API-Fehler15 Mit Fehlergrund Ungültiger Werkzeugaufruf7 Mit Fehlergrund Anweisungen nicht befolgt6 Mit Fehlergrund Falsche Antwort2 Mit Fehlergrund Keine Antwort2

Rang	Modell	Unternehmen	Werkzeugaufrufe-Score	Punktzahl	Korrekte Tests	Antwortzeit (Durchschnitt)
#91	GPT-5.5 none	OpenAI	10.0	6.4	1/1	3.90s
#92	Laguna M.1 medium	Poolside	10.0	6.4	1/1	6.31s
#93	Qwen3.6 Plus Preview medium	Qwen	10.0	6.3	1/1	5.87s
#94	GPT-5 Nano medium	OpenAI	10.0	6.3	1/1	33.3s
#95	Qwen3.5 Plus 2026-02-15 none	Qwen	10.0	6.3	1/1	3.33s
#97	Gemini 2.5 Flash none	Google	10.0	6.2	1/1	1.91s
#98	GLM 5 none	Z.ai	10.0	6.1	1/1	11.1s
#101	Mimo V2 Omni none	Xiaomi	10.0	6.0	1/1	5.40s
#102	Gemma 4 26B A4B none	Google	10.0	6.0	1/1	57.1s
#103	DeepSeek V4 Pro high	DeepSeek	10.0	6.0	1/1	21.3s
#104	Nemotron 3 Ultra 550b A55b none	NVIDIA	10.0	6.0	1/1	2.99s
#105	Nemotron 3 Super medium	NVIDIA	10.0	5.8	1/1	39.7s
#106	Grok 4.20 Beta none	X AI	10.0	5.8	1/1	4.79s
#108	Qwen3.5-Flash none	Qwen	10.0	5.8	1/1	3.67s
#109	GLM 5V Turbo none	Z.ai	10.0	5.8	1/1	4.86s

Werkzeugaufrufe-Ranking