AI BENCHY
Advertise here

AI BENCHY श्रेणी

टूल कॉलिंग क्रमवारी

टूल कॉलिंग मध्ये कोणती AI मॉडेल्स सर्वोत्तम काम करतात, कोणती विश्वासार्ह राहतात आणि सर्वात मोठी दरी कुठे दिसते ते पाहा. क्रम लावा: मेट्रिक ↑.

दाखवलेली मॉडेल्स

15

सरासरी टूल कॉलिंग स्कोअर

8.7

सर्वोत्तम मॉडेल

Grok 4.1 Fast 2.8
क्रमांक मॉडेल कंपनी टूल कॉलिंग स्कोअर स्कोअर बरोबर चाचण्या प्रतिसाद वेळ (सरासरी)
#141 Nemotron 3 Super none NVIDIA 4.7 4.9 0/1 16.0s
#59 GLM 5V Turbo medium Z.ai 7.0 7.2 0/1 12.5s
#118 Qwen3.6 27B none Qwen 9.5 5.6 1/1 6.74s
#2 Gemini 3.5 Flash high Google 9.8 9.6 1/1 4.96s
#99 gpt-oss-120b medium OpenAI 9.8 6.1 1/1 6.91s
#1 Gemini 3 Flash Preview medium Google 10.0 9.8 1/1 12.6s
#3 Gemini 3.5 Flash low Google 10.0 9.4 1/1 3.27s
#4 Gemini 3.1 Pro Preview medium Google 10.0 9.4 1/1 23.1s
#5 Qwen3.7 Max medium Qwen 10.0 9.1 1/1 6.63s
#6 GPT-5.5 low OpenAI 10.0 9.0 1/1 4.96s
#7 Gemini 3.5 Flash medium Google 10.0 9.0 1/1 3.81s
#8 Claude Opus 4.7 none Anthropic 10.0 8.9 1/1 4.74s
#9 GPT-5.5 medium OpenAI 10.0 8.8 1/1 10.6s
#10 Claude Opus 4.8 medium Anthropic 10.0 8.7 1/1 8.96s
#11 Claude Opus 4.7 medium Anthropic 10.0 8.7 1/1 4.17s

टूल कॉलिंग स्कोअर नुसार शीर्ष मॉडेल्स

टूल कॉलिंग स्कोअर विरुद्ध एकूण खर्च

प्रतिसाद वेळ (सरासरी) नुसार शीर्ष मॉडेल्स