AI BENCHY カテゴリ別失敗
ツール呼び出し
回答なし
ツール呼び出し
回答なし
ツール呼び出し で 回答なし が起きやすいAIモデルを確認し、弱点を早く見つけられます。 並び替え: 正解テスト ↓.
| 順位 | モデル | 企業 | 回答なし 件数 | カテゴリスコア | 正解テスト | 応答時間(平均) |
|---|---|---|---|---|---|---|
| #27 | GPT-5.2 medium | OpenAI | 1 | 10.0 | 0/1 | 10.3s |
| #30 | Grok 4.1 Fast medium | X AI | 1 | 10.0 | 0/1 | 27.7s |