無効なツール呼び出し の失敗
どのAIモデルで 無効なツール呼び出し が起きやすいかを確認し、選ぶ前に信頼性のリスクを見極められます。 並び替え: スコア ↑.
カテゴリ
83/83
モデルを絞り込む
現在の検索条件とフィルターに一致するモデルはありません。
| 順位 | モデル | 企業 | 無効なツール呼び出し 件数 | スコア | 合計コスト | 正解テスト | 応答時間(平均) |
|---|---|---|---|---|---|---|---|
| #130 | Qwen3.6 Flash none | Qwen | 2 | 6.1 | $0.062 | 7/22 | 3.74s |
| #129 | Inkling low | Thinkingmachines | 2 | 6.1 | $0.187 | 10/22 | 5.15s |
| #127 | gpt-oss-120b medium | OpenAI | 1 | 6.1 | $0.019 | 9/22 | 21.9s |
| #124 | Gemini 2.5 Flash none | 1 | 6.2 | $0.017 | 9/22 | 6.20s | |
| #125 | Qwen3.5-35B-A3B medium | Qwen | 1 | 6.2 | $0.837 | 11/22 | 112.5s |
| #123 | GPT-5.6 Luna low | OpenAI | 1 | 6.2 | $0.249 | 10/22 | 5.04s |
| #120 | Qwen3.5-Flash medium | Qwen | 1 | 6.2 | $0.139 | 12/22 | 84.8s |
| #116 | Gemma 4 31B medium | 1 | 6.3 | $0.107 | 14/22 | 75.4s | |
| #114 | Ring-2.6-1T medium | Inclusionai | 1 | 6.3 | $0.103 | 11/22 | 68.7s |
| #111 | Gemini 3.1 Flash Lite low | 1 | 6.5 | $0.621 | 12/22 | 16.3s | |
| #110 | Gemini 3.1 Flash Lite Preview low | 1 | 6.5 | $0.646 | 13/22 | 16.7s | |
| #108 | Laguna XS 2.1 medium | Poolside | 1 | 6.5 | $0.068 | 9/22 | 47.9s |
| #107 | MiMo-V2.5 medium | Xiaomi | 1 | 6.5 | $0.082 | 12/22 | 32.2s |
| #105 | Qwen3.6 27B medium | Qwen | 2 | 6.5 | $0.779 | 10/22 | 106.3s |
| #101 | GLM 5.2 none | Z.ai | 1 | 6.6 | $0.128 | 12/22 | 9.34s |