Tool Calling Ranking
See which AI models perform best on Tool Calling, which ones stay reliable, and where the biggest gaps appear. Sort by: Tests Correct ↓.
330/330
Filter models
No models match the current search and filters.
| Rank | Model | Company | Tool Calling Score | Score | Total Cost | Tests Correct | Response Time (avg) |
|---|---|---|---|---|---|---|---|
| #1 | Gemini 3.6 Flash high | 10.0 | 9.9 | $0.699 | 1/1 | 8.35s | |
| #2 | Gemini 3.8 Flash high | 10.0 | 9.9 | $1.595 | 1/1 | 42.6s | |
| #3 | GPT-6 Astra max | OpenAI | 10.0 | 9.9 | $3.803 | 1/1 | 20.6s |
| #4 | GPT-6 Astra high | OpenAI | 10.0 | 9.9 | $3.474 | 1/1 | 8.92s |
| #5 | GPT-6 Astra xhigh | OpenAI | 10.0 | 9.9 | $5.156 | 1/1 | 11.0s |
| #6 | Gemini 3.7 Flash high | 10.0 | 9.8 | $0.646 | 1/1 | 16.3s | |
| #7 | Gemini 3.6 Flash medium | 10.0 | 9.8 | $0.427 | 1/1 | 5.78s | |
| #8 | GPT-5.6 Sol low | OpenAI | 10.0 | 9.5 | $0.357 | 1/1 | 7.56s |
| #9 | GPT-6 Astra low | OpenAI | 10.0 | 9.5 | $1.289 | 1/1 | 4.95s |
| #10 | Gemini 3 Flash Preview medium | 10.0 | 9.5 | $0.763 | 1/1 | 12.6s | |
| #11 | Gemini 3.5 Flash high | 9.8 | 9.4 | $2.011 | 1/1 | 4.96s | |
| #12 | Gemini 3.7 Flash medium | 10.0 | 9.4 | $0.309 | 1/1 | 5.83s | |
| #13 | GPT-5.6 Sol medium | OpenAI | 10.0 | 9.4 | $0.508 | 1/1 | 6.30s |
| #14 | GPT-6 Astra medium | OpenAI | 10.0 | 9.4 | $1.774 | 1/1 | 5.72s |
| #15 | GPT-5.6 Sol high | OpenAI | 10.0 | 9.4 | $0.446 | 1/1 | 7.08s |