AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

AI BENCHY カテゴリ別失敗

パズル解決: 指示に従っていない

パズル解決
指示に従っていない

パズル解決 で 指示に従っていない が起きやすいAIモデルを確認し、弱点を早く見つけられます。

表示モデル数

15

総失敗数

78

最も影響を受けたモデル

Gemini 3.1 Flash Lite 2
順位 モデル 企業 指示に従っていない 件数 カテゴリスコア 正解テスト 応答時間(平均)
#45 GPT-5.4 Mini medium OpenAI 1 7.8 2/3 4.37s
#51 Mimo V2 PRO medium Xiaomi 1 6.4 1/3 5.08s
#54 GPT-5 Mini medium OpenAI 1 5.6 1/3 15.2s
#60 Kimi K2.6 medium Moonshot AI 1 6.0 1/3 25.1s
#62 Step 3.5 Flash medium Stepfun 1 5.3 1/3 7.22s
#70 GPT-5.4 Nano medium OpenAI 1 4.1 0/3 3.79s
#72 DeepSeek V3.2 medium DeepSeek 1 7.0 1/3 37.7s
#75 Ring-2.6-1T medium Inclusionai 1 5.9 1/3 20.7s
#76 Kimi K2.5 medium Moonshot AI 1 5.3 1/3 43.2s
#79 Hunter Alpha medium OpenRouter 1 6.1 1/3 5.35s
#80 Mimo V2 Omni medium Xiaomi 1 5.9 1/3 2.38s
#81 Mercury 2 medium Inception 1 5.4 1/3 949ms
#84 Grok 4.20 Multi Agent Beta medium X AI 1 6.7 1/3 5.19s
#85 Gemma 4 31B none Google 1 6.5 1/3 4.23s
#86 Grok 4.1 Fast medium X AI 1 5.3 1/3 7.40s

指示に従っていない 件数 上位モデル

指示に従っていない 件数 対 スコア

応答時間(平均) 上位モデル

推定無駄コスト 上位モデル