指示に従っていない の失敗
どのAIモデルで 指示に従っていない が起きやすいかを確認し、選ぶ前に信頼性のリスクを見極められます。 並び替え: 応答時間(平均) ↑.
141/141
モデルを絞り込む
現在の検索条件とフィルターに一致するモデルはありません。
| 順位 | モデル | 企業 | 指示に従っていない 件数 | スコア | 合計コスト | 正解テスト | 応答時間(平均) |
|---|---|---|---|---|---|---|---|
| #21 | GPT-5.4 medium | OpenAI | 2 | 8.5 | $1.533 | 15/22 | 23.1s |
| #191 | Grok 4.1 Fast medium | X AI | 4 | 4.7 | $0.069 | 9/19 | 23.8s |
| #85 | KAT-Coder-Pro V2.5 medium | Kwaipilot | 1 | 6.9 | $0.467 | 11/22 | 24.0s |
| #19 | Muse Spark 1.1 medium | Meta | 2 | 8.6 | $1.357 | 15/22 | 25.0s |
| #60 | GPT-5.4 Mini medium | OpenAI | 3 | 7.5 | $0.756 | 12/22 | 25.9s |
| #33 | Step 3.7 Flash medium | Stepfun | 1 | 8.0 | $0.515 | 14/22 | 26.4s |
| #29 | GPT-5 Mini medium | OpenAI | 3 | 8.1 | $0.237 | 12/22 | 27.6s |
| #208 | Grok Build 0.1 none | X AI | 2 | 4.0 | $0.547 | 7/19 | 28.7s |
| #79 | Grok 4.20 medium | X AI | 2 | 7.1 | $0.777 | 12/22 | 29.5s |
| #177 | North Mini Code none | Cohere | 2 | 5.1 | $0.000 | 4/22 | 29.9s |
| #30 | Muse Spark 1.1 high | Meta | 2 | 8.1 | $1.694 | 12/22 | 31.5s |
| #107 | MiMo-V2.5 medium | Xiaomi | 1 | 6.5 | $0.082 | 12/22 | 32.2s |
| #46 | GLM 5 medium | Z.ai | 1 | 7.7 | $0.307 | 15/21 | 33.5s |
| #88 | MiMo-V2.5-Pro medium | Xiaomi | 2 | 6.9 | $0.187 | 12/22 | 33.9s |
| #47 | Claude Opus 4.6 medium | Anthropic | 1 | 7.7 | $3.059 | 13/22 | 34.3s |