エージェントタスク: 無効なツール呼び出し
エージェントタスク
無効なツール呼び出し
エージェントタスク で 無効なツール呼び出し が起きやすいAIモデルを確認し、弱点を早く見つけられます。 並び替え: 応答時間(平均) ↑.
カテゴリ
44/44
モデルを絞り込む
現在の検索条件とフィルターに一致するモデルはありません。
| 順位 | モデル | 企業 | 無効なツール呼び出し 件数 | カテゴリスコア | 合計コスト | 正解テスト | 応答時間(平均) |
|---|---|---|---|---|---|---|---|
| #130 | Inkling medium | Thinkingmachines | 1 | 4.7 | $0.540 | 0/1 | 45.9s |
| #293 | Mercury 2.5 low | Inception | 1 | 5.0 | $0.020 | 0/1 | 47.1s |
| #336 | Granite 4.2 8B none | IBM Granite | 1 | 5.0 | $0.047 | 0/1 | 49.2s |
| #295 | MiMo-V2.5-Pro none | Xiaomi | 1 | 3.9 | $0.157 | 0/1 | 49.6s |
| #267 | GPT-6 Luna none | OpenAI | 1 | 5.0 | $0.026 | 0/1 | 51.1s |
| #195 | GLM 5.3 low | Z.ai | 1 | 5.2 | $0.473 | 0/1 | 51.3s |
| #199 | Grok 4.3 medium | X AI | 1 | 3.9 | $0.989 | 0/1 | 51.6s |
| #85 | Claude Sonnet 5.5 high | Anthropic | 1 | 7.4 | $1.197 | 0/1 | 53.6s |
| #250 | DeepSeek V4.1 Flash none | DeepSeek | 1 | 7.4 | $0.123 | 0/1 | 55.8s |
| #122 | GPT-5.6 Luna medium | OpenAI | 1 | 7.4 | $0.101 | 0/1 | 58.1s |
| #52 | Gemini 3.7 Flash low | 1 | 6.4 | $0.293 | 0/1 | 62.6s | |
| #310 | Hy4 preview none | Tencent | 1 | 5.0 | $0.161 | 0/1 | 65.5s |
| #284 | Qwen3.6 35B A3B none | Qwen | 1 | 5.2 | $0.105 | 0/1 | 65.6s |
| #239 | MiMo-V2.6-Pro none | Xiaomi | 1 | 5.0 | $0.193 | 0/1 | 66.1s |
| #200 | Laguna XS 2.1 medium | Poolside | 1 | 6.1 | $0.083 | 0/1 | 66.4s |