AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

AI BENCHY カテゴリ

ツール呼び出し ランキング

ツール呼び出し でどのAIモデルが最も強いか、どのモデルが安定しているか、差が大きいのはどこかを確認できます。 並び替え: 指標 ↑.

表示モデル数

15

平均 ツール呼び出し スコア

8.7

最良モデル

Grok 4.1 Fast 2.8
順位 モデル 企業 ツール呼び出し スコア スコア 正解テスト 応答時間(平均)
#48 Gemini 3 Flash Preview none Google 10.0 7.4 1/1 3.35s
#49 Qwen3.5-Flash medium Qwen 10.0 7.4 1/1 10.3s
#50 Gemini 3.1 Flash Lite Preview low Google 10.0 7.4 1/1 9.54s
#51 Mimo V2 PRO medium Xiaomi 10.0 7.4 1/1 8.19s
#52 Claude Sonnet 4.6 medium Anthropic 10.0 7.4 1/1 7.48s
#53 Gemini 3.1 Flash Lite high Google 10.0 7.3 1/1 6.44s
#54 GPT-5 Mini medium OpenAI 10.0 7.3 1/1 18.6s
#56 MiMo-V2.5 medium Xiaomi 10.0 7.3 1/1 7.29s
#57 Step 3.7 Flash low Stepfun 10.0 7.3 1/1 3.25s
#58 Gemini 3.1 Flash Lite Preview none Google 10.0 7.2 1/1 3.39s
#60 Kimi K2.6 medium Moonshot AI 10.0 7.2 1/1 8.92s
#61 Gemini 3.1 Flash Lite low Google 10.0 7.2 1/1 5.66s
#62 Step 3.5 Flash medium Stepfun 10.0 7.2 1/1 11.9s
#63 GPT-5.3 Chat none OpenAI 10.0 7.2 1/1 8.36s
#64 MiMo-V2-Flash medium Xiaomi 10.0 7.2 1/1 27.8s

ツール呼び出し スコア 上位モデル

ツール呼び出し スコア vs 合計コスト

応答時間(平均) 上位モデル