无效工具调用 失败
看看哪些 AI 模型最常遇到 无效工具调用,让你在选择前先发现稳定性风险。 排序方式: 测试正确 ↓.
83/83
筛选模型
没有模型匹配当前搜索和筛选条件。
| 排名 | 模型 | 公司 | 无效工具调用 次数 | 分数 | 总成本 | 测试正确 | 响应时间(平均) |
|---|---|---|---|---|---|---|---|
| #82 | DeepSeek V4 Pro none | DeepSeek | 1 | 6.9 | $0.096 | 10/22 | 11.6s |
| #99 | Qwen3.6 27B medium | Qwen | 2 | 6.5 | $0.779 | 10/22 | 106.3s |
| #117 | GPT-5.6 Luna low | OpenAI | 1 | 6.2 | $0.249 | 10/22 | 5.04s |
| #123 | Inkling low | Thinkingmachines | 2 | 6.1 | $0.187 | 10/22 | 5.15s |
| #102 | Laguna XS 2.1 medium | Poolside | 1 | 6.5 | $0.068 | 9/22 | 47.9s |
| #118 | Gemini 2.5 Flash none | 1 | 6.2 | $0.017 | 9/22 | 6.20s | |
| #121 | gpt-oss-120b medium | OpenAI | 1 | 6.1 | $0.019 | 9/22 | 21.9s |
| #137 | North Mini Code medium | Cohere | 1 | 5.9 | $0.000 | 9/22 | 137.1s |
| #125 | Qwen3.5-Flash none | Qwen | 1 | 6.1 | $0.073 | 8/22 | 25.3s |
| #132 | GPT-5.6 Terra none | OpenAI | 1 | 6.0 | $0.349 | 8/22 | 1.65s |
| #156 | Gemma 4 26B A4B none | 1 | 5.5 | $0.015 | 8/22 | 7.64s | |
| #188 | Cobuddy medium | Baidu | 1 | 4.7 | $0.000 | 7/21 | 39.9s |
| #191 | Grok 4.20 Beta none | X AI | 1 | 4.4 | $0.087 | 6/18 | 1.19s |
| #197 | Grok 4.20 none | X AI | 1 | 4.1 | $0.057 | 6/18 | 1.11s |
| #124 | Qwen3.6 Flash none | Qwen | 2 | 6.1 | $0.062 | 7/22 | 3.74s |