AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

AI BENCHY 分类

工具调用 排名

看看哪些 AI 模型在 工具调用 上表现最好,哪些更稳定,以及差距主要出现在哪里。 排序方式: 测试正确 ↑.

显示的模型数

15

工具调用 得分 平均值

8.7

排名 模型 公司 工具调用 得分 分数 测试正确 响应时间(平均)
#87 Gemini 3.1 Flash Lite minimal Google 10.0 6.4 1/1 3.51s
#88 Qwen3.7 Plus none Qwen 10.0 6.4 1/1 3.54s
#90 Gemini 3.1 Flash Lite none Google 10.0 6.4 1/1 2.97s
#91 GPT-5.5 none OpenAI 10.0 6.4 1/1 3.90s
#92 Laguna M.1 medium Poolside 10.0 6.4 1/1 6.31s
#93 Qwen3.6 Plus Preview medium Qwen 10.0 6.3 1/1 5.87s
#94 GPT-5 Nano medium OpenAI 10.0 6.3 1/1 33.3s
#95 Qwen3.5 Plus 2026-02-15 none Qwen 10.0 6.3 1/1 3.33s
#97 Gemini 2.5 Flash none Google 10.0 6.2 1/1 1.91s
#98 GLM 5 none Z.ai 10.0 6.1 1/1 11.1s
#99 gpt-oss-120b medium OpenAI 9.8 6.1 1/1 6.91s
#101 Mimo V2 Omni none Xiaomi 10.0 6.0 1/1 5.40s
#102 Gemma 4 26B A4B none Google 10.0 6.0 1/1 57.1s
#103 DeepSeek V4 Pro high DeepSeek 10.0 6.0 1/1 21.3s
#104 Nemotron 3 Ultra 550b A55b none NVIDIA 10.0 6.0 1/1 2.99s

按 工具调用 得分 排名的顶级模型

工具调用 得分 vs 总成本

按 响应时间(平均) 排名的顶级模型