指示に従っていない の失敗
どのAIモデルで 指示に従っていない が起きやすいかを確認し、選ぶ前に信頼性のリスクを見極められます。 並び替え: スコア ↓.
141/141
モデルを絞り込む
現在の検索条件とフィルターに一致するモデルはありません。
| 順位 | モデル | 企業 | 指示に従っていない 件数 | スコア | 合計コスト | 正解テスト | 応答時間(平均) |
|---|---|---|---|---|---|---|---|
| #89 | Qwen3.6 Flash medium | Qwen | 1 | 6.9 | $0.738 | 12/22 | 44.7s |
| #92 | Gemini 3.5 Flash minimal | 1 | 6.8 | $0.300 | 14/22 | 2.65s | |
| #94 | Qwen3.6 35B A3B medium | Qwen | 1 | 6.7 | $0.746 | 13/22 | 58.1s |
| #96 | LongCat 2.0 low | Meituan | 1 | 6.7 | $0.391 | 10/22 | 100.3s |
| #98 | GLM 5V Turbo medium | Z.ai | 1 | 6.7 | $0.457 | 11/21 | 23.1s |
| #101 | GLM 5.2 none | Z.ai | 1 | 6.6 | $0.128 | 12/22 | 9.34s |
| #102 | LongCat 2.0 high | Meituan | 2 | 6.6 | $0.469 | 9/22 | 148.7s |
| #105 | Qwen3.6 27B medium | Qwen | 1 | 6.5 | $0.779 | 10/22 | 106.3s |
| #106 | Hy3 preview medium | Tencent | 1 | 6.5 | $0.018 | 14/21 | 16.3s |
| #107 | MiMo-V2.5 medium | Xiaomi | 1 | 6.5 | $0.082 | 12/22 | 32.2s |
| #109 | Qwen3.5-27B none | Qwen | 2 | 6.5 | $0.090 | 8/22 | 4.76s |
| #110 | Gemini 3.1 Flash Lite Preview low | 1 | 6.5 | $0.646 | 13/22 | 16.7s | |
| #112 | Gemini 3.1 Flash Lite Preview none | 2 | 6.4 | $0.052 | 12/22 | 1.58s | |
| #114 | Ring-2.6-1T medium | Inclusionai | 2 | 6.3 | $0.103 | 11/22 | 68.7s |
| #115 | Mimo V2 PRO medium | Xiaomi | 1 | 6.3 | $0.333 | 12/21 | 22.2s |