Tool Calling Ranking
See which AI models perform best on Tool Calling, which ones stay reliable, and where the biggest gaps appear. Sort by: Response Time (avg) ↑.
330/330
Filter models
No models match the current search and filters.
| Rank | Model | Company | Tool Calling Score | Score | Total Cost | Tests Correct | Response Time (avg) |
|---|---|---|---|---|---|---|---|
| #53 | DeepSeek V4.1 Flash high | DeepSeek | 10.0 | 8.5 | $0.574 | 1/1 | 15.3s |
| #54 | DeepSeek V4.1 Flash medium | DeepSeek | 10.0 | 8.5 | $0.544 | 1/1 | 15.3s |
| #301 | MiniMax M2.5 medium | Minimax | 10.0 | 4.6 | $0.327 | 1/1 | 15.4s |
| #124 | GLM 5.3 Flash high | Z.ai | 10.0 | 7.3 | $0.034 | 1/1 | 15.6s |
| #165 | GLM 5.2 none | Z.ai | 10.0 | 6.7 | $0.221 | 1/1 | 15.8s |
| #96 | DeepSeek V4 Pro high | DeepSeek | 9.8 | 7.7 | $0.761 | 1/1 | 15.9s |
| #93 | GLM 5 medium | Z.ai | 10.0 | 7.7 | $0.228 | 1/1 | 15.9s |
| #306 | GLM 4.7 Flash medium | Z.ai | 10.0 | 4.3 | $0.168 | 1/1 | 15.9s |
| #284 | Nemotron 3 Super none | NVIDIA | 4.7 | 4.8 | $0.008 | 0/1 | 16.0s |
| #6 | Gemini 3.7 Flash high | 10.0 | 9.8 | $0.646 | 1/1 | 16.3s | |
| #161 | MiMo-V2.5-Pro medium | Xiaomi | 10.0 | 6.8 | $0.221 | 1/1 | 16.9s |
| #180 | Qwen3.6 27B medium | Qwen | 10.0 | 6.5 | $0.577 | 1/1 | 16.9s |
| #48 | Claude Fable 5 medium | Anthropic | 10.0 | 8.6 | $3.004 | 1/1 | 17.0s |
| #221 | GLM 5.3 Flash low | Z.ai | 10.0 | 5.9 | $0.018 | 1/1 | 17.0s |
| #122 | GLM 5.3 high | Z.ai | 10.0 | 7.3 | $0.403 | 1/1 | 17.0s |