コーディング: 指示に従っていない
コーディング
指示に従っていない
コーディング で 指示に従っていない が起きやすいAIモデルを確認し、弱点を早く見つけられます。 並び替え: 正解テスト ↑.
38/38
モデルを絞り込む
現在の検索条件とフィルターに一致するモデルはありません。
| 順位 | モデル | 企業 | 指示に従っていない 件数 | カテゴリスコア | 合計コスト | 正解テスト | 応答時間(平均) |
|---|---|---|---|---|---|---|---|
| #130 | Mistral Large 4 high | Mistral | 1 | 0.3 | $1.391 | 0/3 | 1277.8s |
| #177 | Claude Sonnet 5.5 low | Anthropic | 2 | 0.3 | $0.909 | 0/3 | 5.81s |
| #198 | GLM 5.2 none | Z.ai | 1 | 0.4 | $0.250 | 0/3 | 7.55s |
| #204 | Claude Sonnet 5.5 medium | Anthropic | 2 | 0.3 | $1.100 | 0/3 | 6.07s |
| #243 | Claude Fable 5.1 low | Anthropic | 2 | 0.3 | $3.395 | 0/3 | 6.75s |
| #248 | Qwen3.5 Plus 2026-04-20 none | Qwen | 1 | 0.4 | $0.216 | 0/3 | 1.69s |
| #269 | Trinity Large Thinking high | Arcee AI | 1 | 0.4 | $0.794 | 0/3 | 245.0s |
| #283 | Ling 3.1 Flash none | Inclusionai | 1 | 0.5 | $0.000 | 0/3 | 31.9s |
| #293 | MiMo-V2.6-Flash none | Xiaomi | 1 | 0.4 | $0.060 | 0/3 | 744ms |
| #313 | MiMo-V2.5-Pro none | Xiaomi | 1 | 0.4 | $0.135 | 0/3 | 1.41s |
| #329 | Hy4 preview none | Tencent | 1 | 0.4 | $0.165 | 0/3 | 45.5s |
| #339 | DeepSeek V3.2 none | DeepSeek | 1 | 0.3 | $0.119 | 0/3 | 14.5s |
| #356 | Cobuddy medium | Baidu | 1 | 0.4 | $0.000 | 0/3 | 79.2s |
| #363 | Mercury 2.5 none | Inception | 1 | 0.4 | $0.026 | 0/3 | 12.5s |
| #365 | Qwen3.5-9B medium | Qwen | 1 | 0.3 | $0.106 | 0/3 | 100.9s |