AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

AI BENCHY カテゴリ

指示追従 ランキング

指示追従 でどのAIモデルが最も強いか、どのモデルが安定しているか、差が大きいのはどこかを確認できます。

表示モデル数

15

平均 指示追従 スコア

8.5

順位 モデル 企業 指示追従 スコア スコア 正解テスト 応答時間(平均)
#87 Gemini 3.1 Flash Lite minimal Google 10.0 6.4 2/2 932ms
#89 Hy3 preview low Tencent 10.0 6.4 2/2 16.0s
#90 Gemini 3.1 Flash Lite none Google 10.0 6.4 2/2 859ms
#92 Laguna M.1 medium Poolside 10.0 6.4 2/2 4.30s
#95 Qwen3.5 Plus 2026-02-15 none Qwen 10.0 6.3 2/2 1.67s
#97 Gemini 2.5 Flash none Google 10.0 6.2 2/2 590ms
#98 GLM 5 none Z.ai 10.0 6.1 2/2 1.48s
#103 DeepSeek V4 Pro high DeepSeek 10.0 6.0 2/2 41.2s
#104 Nemotron 3 Ultra 550b A55b none NVIDIA 10.0 6.0 2/2 1.46s
#107 Laguna Xs.2 medium Poolside 10.0 5.8 2/2 1.68s
#110 Seed-2.0-Lite none Bytedance Seed 10.0 5.8 2/2 1.06s
#133 DeepSeek V3.2 none DeepSeek 10.0 5.2 2/2 1.52s
#3 Gemini 3.5 Flash low Google 9.9 9.4 2/2 1.86s
#6 GPT-5.5 low OpenAI 9.9 9.0 2/2 3.74s
#7 Gemini 3.5 Flash medium Google 9.9 9.0 2/2 2.70s

指示追従 スコア 上位モデル

指示追従 スコア vs 合計コスト

応答時間(平均) 上位モデル