Tool Calling Ranking
See which AI models perform best on Tool Calling, which ones stay reliable, and where the biggest gaps appear. Sort by: Response Time (avg) ↑.
330/330
Filter models
No models match the current search and filters.
| Rank | Model | Company | Tool Calling Score | Score | Total Cost | Tests Correct | Response Time (avg) |
|---|---|---|---|---|---|---|---|
| #159 | DeepSeek V4 Pro none | DeepSeek | 10.0 | 6.8 | $0.351 | 1/1 | 7.40s |
| #108 | Qwen3.5-27B medium | Qwen | 10.0 | 7.5 | $0.982 | 1/1 | 7.45s |
| #88 | Claude Sonnet 4.6 medium | Anthropic | 10.0 | 7.8 | $2.126 | 1/1 | 7.48s |
| #304 | Laguna M.1 none | Poolside | 10.0 | 4.4 | $0.009 | 1/1 | 7.54s |
| #107 | Qwen3.5 Plus 2026-02-15 medium | Qwen | 10.0 | 7.5 | $0.459 | 1/1 | 7.54s |
| #8 | GPT-5.6 Sol low | OpenAI | 10.0 | 9.5 | $0.357 | 1/1 | 7.56s |
| #133 | Qwen3.7 Flash low | Qwen | 10.0 | 7.2 | $0.043 | 1/1 | 7.66s |
| #103 | GPT-5.4 Nano medium | OpenAI | 10.0 | 7.5 | $0.142 | 1/1 | 7.71s |
| #101 | Nemotron 3 Ultra medium | NVIDIA | 10.0 | 7.6 | $0.701 | 1/1 | 7.72s |
| #261 | Gemini 3.1 Flash Lite Preview high | 10.0 | 5.3 | $2.310 | 1/1 | 7.73s | |
| #151 | Qwen3.7 Flash medium | Qwen | 10.0 | 6.9 | $0.065 | 1/1 | 7.80s |
| #29 | Qwen3.8 Max medium | Qwen | 10.0 | 9.0 | $0.771 | 1/1 | 7.83s |
| #158 | Solar Pro 4 medium | Upstage | 10.0 | 6.8 | $0.140 | 1/1 | 7.86s |
| #102 | Claude Opus 5 none | Anthropic | 10.0 | 7.5 | $1.550 | 1/1 | 7.89s |
| #50 | Qwen3.8 Max low | Qwen | 10.0 | 8.6 | $0.702 | 1/1 | 8.06s |