コーディング: 指示に従っていない
コーディング
指示に従っていない
コーディング で 指示に従っていない が起きやすいAIモデルを確認し、弱点を早く見つけられます。 並び替え: 応答時間(平均) ↓.
25/25
モデルを絞り込む
現在の検索条件とフィルターに一致するモデルはありません。
| 順位 | モデル | 企業 | 指示に従っていない 件数 | カテゴリスコア | 合計コスト | 正解テスト | 応答時間(平均) |
|---|---|---|---|---|---|---|---|
| #126 | Seed-2.0-Code high | Bytedance Seed | 1 | 6.2 | $1.273 | 1/3 | 266.7s |
| #54 | DeepSeek V4 Flash 0731 high | DeepSeek | 1 | 6.3 | $0.134 | 1/3 | 252.7s |
| #42 | Qwen3.8 27B high | Qwen | 1 | 8.1 | ~$0.287 | 2/3 | 248.6s |
| #252 | Trinity Large Thinking high | Arcee AI | 1 | 3.7 | $0.624 | 0/3 | 245.0s |
| #283 | Ling 3.0 Tiny medium | Inclusionai | 1 | 2.9 | $0.000 | 0/3 | 212.0s |
| #176 | Trinity Large Thinking medium | Arcee AI | 1 | 7.5 | $0.798 | 2/3 | 179.0s |
| #279 | Ling 3.0 Tiny high | Inclusionai | 1 | 2.9 | $0.000 | 0/3 | 177.7s |
| #280 | Ling 3.0 Tiny low | Inclusionai | 1 | 2.9 | $0.000 | 0/3 | 170.7s |
| #95 | Qwen3.8 2.4T A95B high | Qwen | 1 | 5.9 | $2.357 | 1/3 | 160.5s |
| #282 | Qwen3.5-9B medium | Qwen | 1 | 2.9 | $0.062 | 0/3 | 100.9s |
| #203 | Kimi K2.6 none | Moonshot AI | 1 | 5.5 | $0.230 | 1/3 | 82.6s |
| #260 | Cobuddy medium | Baidu | 1 | 3.7 | $0.000 | 0/3 | 79.2s |
| #259 | Laguna M.1 medium | Poolside | 1 | 1.5 | $0.033 | 0/1 | 35.6s |
| #74 | Claude Opus 4.6 medium | Anthropic | 1 | 5.7 | $2.961 | 1/3 | 30.1s |
| #258 | Grok 4.1 Fast medium | X AI | 1 | 7.8 | $0.069 | 0/1 | 23.6s |