无效工具调用 失败
看看哪些 AI 模型最常遇到 无效工具调用,让你在选择前先发现稳定性风险。 排序方式: 总成本 ↑.
83/83
筛选模型
没有模型匹配当前搜索和筛选条件。
| 排名 | 模型 | 公司 | 无效工具调用 次数 | 分数 | 总成本 | 测试正确 | 响应时间(平均) |
|---|---|---|---|---|---|---|---|
| #142 | Qwen3.5-122B-A10B none | Qwen | 1 | 5.7 | $0.247 | 6/22 | 12.9s |
| #117 | GPT-5.6 Luna low | OpenAI | 1 | 6.2 | $0.249 | 10/22 | 5.04s |
| #36 | Qwen3.7 Plus medium | Qwen | 1 | 7.9 | $0.267 | 15/22 | 51.5s |
| #88 | Gemini 3.5 Flash minimal | 2 | 6.8 | $0.300 | 14/22 | 2.65s | |
| #190 | MiniMax M2.5 medium | Minimax | 1 | 4.6 | $0.340 | 5/22 | 68.3s |
| #132 | GPT-5.6 Terra none | OpenAI | 1 | 6.0 | $0.349 | 8/22 | 1.65s |
| #32 | Inkling medium | Thinkingmachines | 1 | 8.0 | $0.391 | 15/22 | 16.2s |
| #11 | Gemini 3.5 Flash low | 1 | 8.9 | $0.433 | 19/22 | 5.55s | |
| #57 | Qwen3.5 Plus 2026-02-15 medium | Qwen | 1 | 7.5 | $0.437 | 14/22 | 89.2s |
| #67 | Step 3.7 Flash low | Stepfun | 1 | 7.3 | $0.454 | 12/22 | 20.7s |
| #93 | GLM 5V Turbo medium | Z.ai | 2 | 6.7 | $0.457 | 11/21 | 23.1s |
| #92 | KAT-Coder-Pro V2.5 none | Kwaipilot | 1 | 6.7 | $0.476 | 11/22 | 25.6s |
| #69 | KAT-Coder-Pro V2.5 high | Kwaipilot | 1 | 7.2 | $0.482 | 11/22 | 20.8s |
| #29 | Step 3.7 Flash medium | Stepfun | 1 | 8.0 | $0.515 | 14/22 | 26.4s |
| #55 | GPT-5.6 Terra low | OpenAI | 1 | 7.5 | $0.519 | 13/22 | 5.31s |