Tool Calling Ranking
See which AI models perform best on Tool Calling, which ones stay reliable, and where the biggest gaps appear. Sort by: Response Time (avg) ↓.
330/330
Filter models
No models match the current search and filters.
| Rank | Model | Company | Tool Calling Score | Score | Total Cost | Tests Correct | Response Time (avg) |
|---|---|---|---|---|---|---|---|
| #320 | Ling 3.0 Tiny low | Inclusionai | 10.0 | 3.8 | $0.000 | 1/1 | 5.94s |
| #166 | KAT-Coder-Pro V2.5 none | Kwaipilot | 10.0 | 6.7 | $0.487 | 1/1 | 5.93s |
| #37 | Qwen3.8 Max (0902) medium | Qwen | 10.0 | 8.8 | $0.677 | 1/1 | 5.93s |
| #84 | Qwen3.6 Plus medium | Qwen | 10.0 | 7.8 | $0.418 | 1/1 | 5.87s |
| #281 | Qwen3.6 Plus Preview medium | Qwen | 10.0 | 4.9 | $0.000 | 1/1 | 5.87s |
| #58 | Grok 4.5 low | X AI | 10.0 | 8.4 | $0.945 | 1/1 | 5.83s |
| #12 | Gemini 3.7 Flash medium | 10.0 | 9.4 | $0.309 | 1/1 | 5.83s | |
| #7 | Gemini 3.6 Flash medium | 10.0 | 9.8 | $0.427 | 1/1 | 5.78s | |
| #319 | Ling 3.0 Tiny high | Inclusionai | 10.0 | 3.8 | $0.000 | 1/1 | 5.76s |
| #92 | Qwen3.7 Flash high | Qwen | 10.0 | 7.8 | $0.052 | 1/1 | 5.72s |
| #14 | GPT-6 Astra medium | OpenAI | 10.0 | 9.4 | $1.774 | 1/1 | 5.72s |
| #30 | Grok 4.5 high | X AI | 10.0 | 9.0 | $2.252 | 1/1 | 5.71s |
| #176 | Gemini 3.1 Flash Lite low | 10.0 | 6.6 | $0.621 | 1/1 | 5.66s | |
| #134 | Muse Glimmer 30B medium | Meta | 10.0 | 7.2 | $0.211 | 1/1 | 5.64s |
| #60 | Qwen3.8 27B high | Qwen | 10.0 | 8.4 | ~$0.287 | 1/1 | 5.62s |