AI BENCHY 分类失败
综合
无效工具调用
综合
无效工具调用
看看哪些 AI 模型在 综合 上最容易遇到 无效工具调用,更快找出薄弱点。 排序方式: 响应时间(平均) ↑.
相关分类
| 排名 | 模型 | 公司 | 无效工具调用 次数 | 分类得分 | 测试正确 | 响应时间(平均) |
|---|---|---|---|---|---|---|
| #49 | GLM 4.7 Flash none | Z.ai | 1 | 10.0 | 0/1 | 3.22s |
| #43 | MiniMax M2.5 medium | Minimax | 1 | 10.0 | 0/1 | 60.4s |
| #52 | GLM 4.7 Flash medium | Z.ai | 1 | 10.0 | 0/1 | 65.6s |
| #33 | DeepSeek V3.2 none | DeepSeek | 1 | 8.0 | 0/1 | 115.9s |