AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

AI BENCHY カテゴリ

ツール呼び出し ランキング

ツール呼び出し でどのAIモデルが最も強いか、どのモデルが安定しているか、差が大きいのはどこかを確認できます。 並び替え: 正解テスト ↑.

表示モデル数

15

平均 ツール呼び出し スコア

8.7

最良モデル

Grok 4.20 Beta 3.0
順位 モデル 企業 ツール呼び出し スコア スコア 正解テスト 応答時間(平均)
#50 Gemini 3.1 Flash Lite Preview low Google 10.0 7.4 1/1 9.54s
#51 Mimo V2 PRO medium Xiaomi 10.0 7.4 1/1 8.19s
#52 Claude Sonnet 4.6 medium Anthropic 10.0 7.4 1/1 7.48s
#53 Gemini 3.1 Flash Lite high Google 10.0 7.3 1/1 6.44s
#54 GPT-5 Mini medium OpenAI 10.0 7.3 1/1 18.6s
#56 MiMo-V2.5 medium Xiaomi 10.0 7.3 1/1 7.29s
#57 Step 3.7 Flash low Stepfun 10.0 7.3 1/1 3.25s
#58 Gemini 3.1 Flash Lite Preview none Google 10.0 7.2 1/1 3.39s
#60 Kimi K2.6 medium Moonshot AI 10.0 7.2 1/1 8.92s
#61 Gemini 3.1 Flash Lite low Google 10.0 7.2 1/1 5.66s
#62 Step 3.5 Flash medium Stepfun 10.0 7.2 1/1 11.9s
#63 GPT-5.3 Chat none OpenAI 10.0 7.2 1/1 8.36s
#64 MiMo-V2-Flash medium Xiaomi 10.0 7.2 1/1 27.8s
#66 Qwen3.5-35B-A3B medium Qwen 10.0 7.1 1/1 4.65s
#67 MiniMax M3 medium Minimax 10.0 7.1 1/1 11.9s

ツール呼び出し スコア 上位モデル

ツール呼び出し スコア vs 合計コスト

応答時間(平均) 上位モデル