AI BENCHY
Your ad here

AI BENCHY カテゴリ

指示追従 ランキング

指示追従 でどのAIモデルが最も強いか、どのモデルが安定しているか、差が大きいのはどこかを確認できます。 並び替え: 指標 ↑.

表示モデル数

8

平均 指示追従 スコア

8.0

最良モデル

Grok 4.1 Fast 3.0
順位 モデル 企業 指示追従 スコア スコア 正解テスト 応答時間(平均)
#41 MiMo-V2-Flash medium Xiaomi 10.0 7.5 2/2 4.28s
#43 Qwen3.5-35B-A3B medium Qwen 10.0 7.4 2/2 24.4s
#46 Kimi K2.5 medium Moonshot AI 10.0 7.0 2/2 92.5s
#49 Qwen3.5 Plus 2026-02-15 none Qwen 10.0 6.8 2/2 1.67s
#53 GLM 5 none Z.ai 10.0 6.6 2/2 1.48s
#54 Mercury 2 medium Inception 10.0 6.5 2/2 1.07s
#61 Seed-2.0-Lite none Bytedance Seed 10.0 6.2 2/2 1.06s
#64 DeepSeek V3.2 none DeepSeek 10.0 6.1 2/2 1.52s

指示追従 スコア 上位モデル

指示追従 スコア vs 合計コスト

応答時間(平均) 上位モデル