无效工具调用 失败
看看哪些 AI 模型最常遇到 无效工具调用,让你在选择前先发现稳定性风险。 排序方式: 分数 ↑.
83/83
筛选模型
没有模型匹配当前搜索和筛选条件。
| 排名 | 模型 | 公司 | 无效工具调用 次数 | 分数 | 总成本 | 测试正确 | 响应时间(平均) |
|---|---|---|---|---|---|---|---|
| #124 | Qwen3.6 Flash none | Qwen | 2 | 6.1 | $0.062 | 7/22 | 3.74s |
| #123 | Inkling low | Thinkingmachines | 2 | 6.1 | $0.187 | 10/22 | 5.15s |
| #121 | gpt-oss-120b medium | OpenAI | 1 | 6.1 | $0.019 | 9/22 | 21.9s |
| #118 | Gemini 2.5 Flash none | 1 | 6.2 | $0.017 | 9/22 | 6.20s | |
| #119 | Qwen3.5-35B-A3B medium | Qwen | 1 | 6.2 | $0.837 | 11/22 | 112.5s |
| #117 | GPT-5.6 Luna low | OpenAI | 1 | 6.2 | $0.249 | 10/22 | 5.04s |
| #114 | Qwen3.5-Flash medium | Qwen | 1 | 6.2 | $0.139 | 12/22 | 84.8s |
| #110 | Gemma 4 31B medium | 1 | 6.3 | $0.163 | 14/22 | 75.4s | |
| #108 | Ring-2.6-1T medium | Inclusionai | 1 | 6.3 | $0.103 | 11/22 | 68.7s |
| #105 | Gemini 3.1 Flash Lite low | 1 | 6.5 | $0.621 | 12/22 | 16.3s | |
| #104 | Gemini 3.1 Flash Lite Preview low | 1 | 6.5 | $0.646 | 13/22 | 16.7s | |
| #102 | Laguna XS 2.1 medium | Poolside | 1 | 6.5 | $0.068 | 9/22 | 47.9s |
| #101 | MiMo-V2.5 medium | Xiaomi | 1 | 6.5 | $0.082 | 12/22 | 32.2s |
| #99 | Qwen3.6 27B medium | Qwen | 2 | 6.5 | $0.779 | 10/22 | 106.3s |
| #96 | GLM 5.2 none | Z.ai | 1 | 6.6 | $0.151 | 12/22 | 9.34s |