指示に従っていない の失敗
どのAIモデルで 指示に従っていない が起きやすいかを確認し、選ぶ前に信頼性のリスクを見極められます。 並び替え: 正解テスト ↓.
215/215
モデルを絞り込む
現在の検索条件とフィルターに一致するモデルはありません。
| 順位 | モデル | 企業 | 指示に従っていない 件数 | スコア | 合計コスト | 正解テスト | 応答時間(平均) |
|---|---|---|---|---|---|---|---|
| #288 | Elephant Alpha none | Openrouter | 3 | 4.3 | $0.000 | 5/21 | 1.22s |
| #227 | Nemotron 3.5 Lightning high | NVIDIA | 4 | 5.6 | $0.134 | 5/22 | 58.3s |
| #237 | MiMo-V2.5-Pro none | Xiaomi | 4 | 5.4 | $0.068 | 5/22 | 4.24s |
| #241 | Inkling Small none | Thinkingmachines | 1 | 5.3 | $0.054 | 5/22 | 1.51s |
| #242 | Laguna XS 2.1 none | Poolside | 1 | 5.3 | $0.008 | 5/22 | 1.55s |
| #250 | Nemotron 3.5 Lightning medium | NVIDIA | 3 | 5.1 | $0.156 | 5/22 | 70.1s |
| #251 | Mistral Small 4 none | Mistral | 1 | 5.1 | $0.022 | 5/22 | 1.20s |
| #252 | Mistral Small 4 medium | Mistral | 2 | 5.1 | $0.097 | 5/22 | 10.8s |
| #254 | Qwen3 Coder Next none | Qwen | 1 | 5.1 | $0.026 | 5/22 | 8.63s |
| #255 | MiMo-V2.5 none | Xiaomi | 1 | 5.1 | $0.025 | 5/22 | 4.68s |
| #259 | MiniMax M2.7 medium | Minimax | 5 | 5.0 | $0.208 | 5/22 | 43.2s |
| #263 | GPT-4o-mini none | OpenAI | 1 | 5.0 | $0.010 | 5/22 | 1.92s |
| #267 | Nemotron 3 Super none | NVIDIA | 2 | 4.8 | $0.008 | 5/22 | 6.04s |
| #270 | Nemotron 3.5 Lightning low | NVIDIA | 2 | 4.8 | $0.140 | 5/22 | 59.8s |
| #272 | Trinity Large Thinking high | Arcee AI | 4 | 4.8 | $0.592 | 5/22 | 75.9s |