工具调用 排名
看看哪些 AI 模型在 工具调用 上表现最好,哪些更稳定,以及差距主要出现在哪里。 排序方式: 指标 ↑.
216/216
筛选模型
没有模型匹配当前搜索和筛选条件。
| 排名 | 模型 | 公司 | 工具调用 得分 | 分数 | 总成本 | 测试正确 | 响应时间(平均) |
|---|---|---|---|---|---|---|---|
| #27 | Muse Spark 1.1 low | Meta | 9.8 | 8.3 | $0.647 | 1/1 | 5.98s |
| #50 | DeepSeek V4 Pro high | DeepSeek | 9.8 | 7.7 | $0.200 | 1/1 | 15.9s |
| #95 | Gemini 3.5 Flash-Lite low | 9.8 | 6.7 | $0.145 | 1/1 | 1.76s | |
| #127 | gpt-oss-120b medium | OpenAI | 9.8 | 6.1 | $0.019 | 1/1 | 6.91s |
| #1 | Gemini 3.6 Flash medium | 10.0 | 9.9 | $0.831 | 1/1 | 8.55s | |
| #2 | Gemini 3.6 Flash high | 10.0 | 9.7 | $1.785 | 1/1 | 9.76s | |
| #3 | Gemini 3 Flash Preview medium | 10.0 | 9.6 | $0.742 | 1/1 | 12.6s | |
| #5 | GPT-5.6 Sol low | OpenAI | 10.0 | 9.5 | $0.971 | 1/1 | 7.56s |
| #6 | Gemini 3.6 Flash low | 10.0 | 9.4 | $0.517 | 1/1 | 4.78s | |
| #7 | GPT-5.6 Sol medium | OpenAI | 10.0 | 9.4 | $1.316 | 1/1 | 6.30s |
| #8 | GPT-5.6 Sol high | OpenAI | 10.0 | 9.4 | $1.234 | 1/1 | 7.08s |
| #9 | GPT-5.5 low | OpenAI | 10.0 | 9.3 | $1.253 | 1/1 | 4.96s |
| #10 | Gemini 3.1 Pro Preview medium | 10.0 | 9.2 | $1.361 | 1/1 | 23.1s | |
| #11 | Qwen3.7 Max medium | Qwen | 10.0 | 9.2 | $1.116 | 1/1 | 6.63s |
| #12 | Gemini 3.5 Flash medium | 10.0 | 9.1 | $0.642 | 1/1 | 3.81s |