AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

AI BENCHY カテゴリ別失敗

コーディング: 指示に従っていない

コーディング
指示に従っていない

コーディング で 指示に従っていない が起きやすいAIモデルを確認し、弱点を早く見つけられます。 並び替え: 応答時間(平均) ↑.

表示モデル数

15

総失敗数

16

最も影響を受けたモデル

Granite 4.1 8B 1
順位 モデル 企業 指示に従っていない 件数 カテゴリスコア 正解テスト 応答時間(平均)
#153 Granite 4.1 8B none IBM Granite 1 5.2 0/2 706ms
#115 MiMo-V2.5-Pro none Xiaomi 1 5.0 0/2 1.80s
#149 MiMo-V2-Flash none Xiaomi 1 4.9 0/2 2.04s
#101 Qwen3.5 Plus 2026-04-20 none Qwen 1 4.4 0/2 2.08s
#24 Gemini 3.5 Flash minimal Google 1 7.0 1/2 3.39s
#6 Gemini 3.5 Flash medium Google 1 6.8 1/2 9.91s
#100 Owl Alpha medium Openrouter 1 6.6 1/2 19.1s
#114 DeepSeek V3.2 none DeepSeek 1 3.1 0/2 20.9s
#87 Grok 4.1 Fast medium X AI 1 2.3 0/1 23.6s
#63 Claude Opus 4.6 medium Anthropic 1 7.2 1/2 29.4s
#74 Laguna M.1 medium Poolside 1 4.3 0/1 35.6s
#80 DeepSeek V4 Pro high DeepSeek 1 2.8 0/2 51.8s
#96 Nemotron 3 Super medium NVIDIA 1 3.1 0/2 62.4s
#105 Cobuddy medium Baidu 1 4.1 0/2 79.2s
#110 Kimi K2.6 none Moonshot AI 1 6.8 1/2 122.8s

指示に従っていない 件数 上位モデル

指示に従っていない 件数 対 スコア

応答時間(平均) 上位モデル

推定無駄コスト 上位モデル