AI BENCHY
Advertise here

AI BENCHY カテゴリ

指示追従 ランキング

指示追従 でどのAIモデルが最も強いか、どのモデルが安定しているか、差が大きいのはどこかを確認できます。 並び替え: 応答時間(平均) ↓.

表示モデル数

15

平均 指示追従 スコア

8.5

最良モデル

Kimi K2.5 10.0
順位 モデル 企業 指示追従 スコア スコア 正解テスト 応答時間(平均)
#62 Step 3.5 Flash medium Stepfun 8.3 7.2 1/2 4.78s
#86 Grok 4.1 Fast medium X AI 6.5 6.5 1/2 4.63s
#92 Laguna M.1 medium Poolside 10.0 6.4 2/2 4.30s
#64 MiMo-V2-Flash medium Xiaomi 10.0 7.2 2/2 4.28s
#65 Grok 4.20 medium X AI 9.8 7.1 2/2 4.26s
#101 Mimo V2 Omni none Xiaomi 6.5 6.0 1/2 4.26s
#79 Hunter Alpha medium OpenRouter 9.9 6.7 2/2 4.18s
#1 Gemini 3 Flash Preview medium Google 10.0 9.8 2/2 4.04s
#6 GPT-5.5 low OpenAI 9.9 9.0 2/2 3.74s
#59 GLM 5V Turbo medium Z.ai 9.9 7.2 2/2 3.74s
#84 Grok 4.20 Multi Agent Beta medium X AI 9.8 6.6 2/2 3.52s
#63 GPT-5.3 Chat none OpenAI 9.8 7.2 2/2 3.51s
#93 Qwen3.6 Plus Preview medium Qwen 6.5 6.3 1/2 3.40s
#20 Gemini 3.5 Flash none Google 9.8 8.1 2/2 3.38s
#9 GPT-5.5 medium OpenAI 10.0 8.8 2/2 3.36s

指示追従 スコア 上位モデル

指示追従 スコア vs 合計コスト

応答時間(平均) 上位モデル