Tool Calling Ranking
See which AI models perform best on Tool Calling, which ones stay reliable, and where the biggest gaps appear. Sort by: Response Time (avg) ↑.
330/330
Filter models
No models match the current search and filters.
| Rank | Model | Company | Tool Calling Score | Score | Total Cost | Tests Correct | Response Time (avg) |
|---|---|---|---|---|---|---|---|
| #293 | Trinity Large Preview none | Arcee AI | 10.0 | 4.8 | $0.008 | 1/1 | 6.67s |
| #104 | GPT-5.6 Terra low | OpenAI | 4.7 | 7.5 | $0.420 | 0/1 | 6.69s |
| #244 | Qwen3.6 27B none | Qwen | 9.5 | 5.5 | $0.062 | 1/1 | 6.74s |
| #196 | Claude Sonnet 5 none | Anthropic | 10.0 | 6.1 | $0.548 | 1/1 | 6.80s |
| #91 | Claude Opus 4.8 low | Anthropic | 10.0 | 7.8 | $2.089 | 1/1 | 6.85s |
| #199 | gpt-oss-120b medium | OpenAI | 9.8 | 6.1 | $0.070 | 1/1 | 6.91s |
| #242 | Nemotron 3.5 Lightning high | NVIDIA | 10.0 | 5.6 | $0.134 | 1/1 | 6.92s |
| #186 | Dots 3 Note Preview high | Dots Studio | 10.0 | 6.4 | $0.000 | 1/1 | 6.96s |
| #47 | Muse Spark 1.1 medium | Meta | 9.8 | 8.6 | $1.420 | 1/1 | 6.99s |
| #292 | GLM 4.7 Flash none | Z.ai | 2.8 | 4.8 | $0.016 | 0/1 | 7.05s |
| #15 | GPT-5.6 Sol high | OpenAI | 10.0 | 9.4 | $0.446 | 1/1 | 7.08s |
| #157 | Solar Pro 4 low | Upstage | 10.0 | 6.8 | $0.130 | 1/1 | 7.12s |
| #188 | MiMo-V2.5 medium | Xiaomi | 10.0 | 6.4 | $0.104 | 1/1 | 7.29s |
| #185 | Dots 3 Note Preview low | Dots Studio | 10.0 | 6.4 | $0.000 | 1/1 | 7.36s |
| #67 | Muse Spark 1.3 low | Meta | 10.0 | 8.2 | $0.689 | 1/1 | 7.39s |