综合:无效工具调用
综合
无效工具调用
看看哪些 AI 模型在 综合 上最容易遇到 无效工具调用,更快找出薄弱点。 排序方式: 响应时间(平均) ↑.
77/77
筛选模型
没有模型匹配当前搜索和筛选条件。
| 排名 | 模型 | 公司 | 无效工具调用 次数 | 分类得分 | 总成本 | 测试正确 | 响应时间(平均) |
|---|---|---|---|---|---|---|---|
| #192 | Laguna M.1 none | Poolside | 1 | 1.5 | $0.009 | 0/1 | 4.32s |
| #197 | Grok 4.20 none | X AI | 1 | 1.5 | $0.057 | 0/1 | 6.04s |
| #191 | Grok 4.20 Beta none | X AI | 1 | 1.5 | $0.087 | 0/1 | 6.48s |
| #159 | GPT-5.6 Luna none | OpenAI | 1 | 3.2 | $0.142 | 0/2 | 6.68s |
| #132 | GPT-5.6 Terra none | OpenAI | 1 | 2.9 | $0.349 | 0/2 | 7.02s |
| #78 | Mercury 2 medium | Inception | 1 | 6.7 | $0.093 | 1/2 | 7.84s |
| #201 | Granite 4.1 8B none | IBM Granite | 2 | 3.0 | $0.007 | 0/2 | 9.28s |
| #55 | GPT-5.6 Terra low | OpenAI | 1 | 8.7 | $0.519 | 1/2 | 9.68s |
| #160 | Laguna XS 2.1 none | Poolside | 1 | 3.0 | $0.008 | 0/2 | 10.4s |
| #117 | GPT-5.6 Luna low | OpenAI | 1 | 2.8 | $0.249 | 0/2 | 13.7s |
| #34 | GPT-5.6 Terra high | OpenAI | 1 | 8.7 | $1.055 | 1/2 | 13.7s |
| #88 | Gemini 3.5 Flash minimal | 2 | 3.0 | $0.300 | 0/2 | 14.4s | |
| #93 | GLM 5V Turbo medium | Z.ai | 1 | 3.4 | $0.457 | 0/1 | 15.1s |
| #64 | Gemini 3.1 Flash Lite Preview medium | 1 | 7.2 | $0.115 | 1/2 | 16.6s | |
| #65 | Gemini 3.1 Flash Lite medium | 1 | 7.2 | $0.117 | 1/2 | 18.5s |