AI BENCHY カテゴリ別失敗
複合: 無効なツール呼び出し
複合
無効なツール呼び出し
複合 で 無効なツール呼び出し が起きやすいAIモデルを確認し、弱点を早く見つけられます。
22/22
モデルを絞り込む
現在の検索条件とフィルターに一致するモデルはありません。
| 順位 | モデル | 企業 | 無効なツール呼び出し 件数 | カテゴリスコア | 合計コスト | 正解テスト | 応答時間(平均) |
|---|---|---|---|---|---|---|---|
| #37 | Claude Sonnet 5 medium | Anthropic | 1 | 4.5 | $0.550 | 0/1 | 37.0s |
| #72 | GLM 5V Turbo medium | Z.ai | 1 | 6.9 | $0.457 | 0/1 | 15.1s |
| #88 | Gemini 3.5 Flash minimal | 1 | 3.0 | $0.108 | 0/1 | 3.56s | |
| #99 | Qwen3.6 27B medium | Qwen | 1 | 7.0 | $0.336 | 0/1 | 83.1s |
| #123 | GPT-5.6 Terra none | OpenAI | 1 | 3.0 | $0.130 | 0/1 | 3.97s |
| #126 | Qwen3.6 Flash none | Qwen | 1 | 3.0 | $0.015 | 0/1 | 4.22s |
| #141 | GLM 5.1 none | Z.ai | 1 | 2.8 | $0.057 | 0/1 | 32.6s |
| #142 | DeepSeek V4 Flash none | DeepSeek | 1 | 4.5 | $0.007 | 0/1 | 112.0s |
| #145 | Qwen3.6 27B none | Qwen | 1 | 3.0 | $0.025 | 0/1 | 9.95s |
| #153 | DeepSeek V3.2 none | DeepSeek | 1 | 6.5 | $0.016 | 0/1 | 115.9s |
| #154 | MiniMax M2.7 medium | Minimax | 1 | 4.7 | $0.100 | 0/1 | 41.0s |
| #158 | North Mini Code none | Cohere | 1 | 3.5 | $0.000 | 0/1 | 159.8s |
| #162 | Qwen3.5-9B none | Qwen | 1 | 3.0 | $0.006 | 0/1 | 5.91s |
| #167 | Cobuddy medium | Baidu | 1 | 3.0 | $0.000 | 0/1 | 47.4s |
| #169 | GLM 4.7 Flash none | Z.ai | 1 | 3.0 | $0.004 | 0/1 | 3.22s |