无效工具调用 失败
看看哪些 AI 模型最常遇到 无效工具调用,让你在选择前先发现稳定性风险。 排序方式: 测试正确 ↑.
83/83
筛选模型
没有模型匹配当前搜索和筛选条件。
| 排名 | 模型 | 公司 | 无效工具调用 次数 | 分数 | 总成本 | 测试正确 | 响应时间(平均) |
|---|---|---|---|---|---|---|---|
| #28 | Inkling high | Thinkingmachines | 2 | 8.0 | $1.006 | 15/22 | 64.2s |
| #32 | Inkling medium | Thinkingmachines | 1 | 8.0 | $0.391 | 15/22 | 16.2s |
| #36 | Qwen3.7 Plus medium | Qwen | 1 | 7.9 | $0.267 | 15/22 | 51.5s |
| #23 | Claude Sonnet 5 medium | Anthropic | 1 | 8.3 | $0.922 | 16/22 | 12.5s |
| #17 | Claude Fable 5 medium | Anthropic | 1 | 8.6 | $3.478 | 17/22 | 17.2s |
| #8 | Qwen3.7 Max medium | Qwen | 1 | 9.2 | $1.116 | 18/22 | 40.6s |
| #11 | Gemini 3.5 Flash low | 1 | 8.9 | $0.433 | 19/22 | 5.55s | |
| #2 | Gemini 3.5 Flash high | 1 | 9.5 | $1.976 | 20/22 | 15.1s |