AI BENCHY
Advertise here

AI BENCHY カテゴリ別失敗

ツール呼び出し: 無効なツール呼び出し

ツール呼び出し
無効なツール呼び出し

ツール呼び出し で 無効なツール呼び出し が起きやすいAIモデルを確認し、弱点を早く見つけられます。 並び替え: 失敗数 ↑.

表示モデル数

7

総失敗数

7

最も影響を受けたモデル

GLM 5V Turbo 1
順位 モデル 企業 無効なツール呼び出し 件数 カテゴリスコア 正解テスト 応答時間(平均)
#59 GLM 5V Turbo medium Z.ai 1 7.0 0/1 12.5s
#107 Laguna Xs.2 medium Poolside 1 4.7 0/1 3.39s
#136 Elephant Alpha medium Openrouter 1 3.0 0/1 2.83s
#137 Elephant Alpha none Openrouter 1 3.0 0/1 2.79s
#138 Ling-2.6-flash none Inclusionai 1 3.0 0/1 18.8s
#146 Laguna Xs.2 none Poolside 1 3.0 0/1 1.93s
#159 Ling-2.6-1T none Inclusionai 1 3.0 0/1 25.7s

無効なツール呼び出し 件数 上位モデル

無効なツール呼び出し 件数 対 スコア

応答時間(平均) 上位モデル

推定無駄コスト 上位モデル