反AIトリック: 指示に従っていない
反AIトリック
指示に従っていない
反AIトリック で 指示に従っていない が起きやすいAIモデルを確認し、弱点を早く見つけられます。 並び替え: 応答時間(平均) ↑.
32/32
モデルを絞り込む
現在の検索条件とフィルターに一致するモデルはありません。
| 順位 | モデル | 企業 | 指示に従っていない 件数 | カテゴリスコア | 合計コスト | 正解テスト | 応答時間(平均) |
|---|---|---|---|---|---|---|---|
| #205 | Laguna Xs.2 none | Poolside | 1 | 3.0 | $0.004 | 0/4 | 534ms |
| #160 | Laguna XS 2.1 none | Poolside | 1 | 5.3 | $0.008 | 1/4 | 755ms |
| #201 | Granite 4.1 8B none | IBM Granite | 1 | 4.9 | $0.007 | 1/4 | 844ms |
| #193 | Elephant Alpha none | Openrouter | 1 | 6.6 | $0.000 | 2/4 | 963ms |
| #106 | Gemini 3.1 Flash Lite Preview none | 1 | 7.5 | $0.052 | 2/4 | 1.04s | |
| #203 | Grok 4.1 Fast none | X AI | 1 | 3.2 | $0.008 | 0/4 | 1.07s |
| #78 | Mercury 2 medium | Inception | 1 | 6.9 | $0.093 | 2/4 | 1.12s |
| #157 | Mimo V2 Omni none | Xiaomi | 1 | 3.6 | $0.021 | 0/4 | 1.63s |
| #64 | Gemini 3.1 Flash Lite Preview medium | 1 | 9.1 | $0.115 | 3/4 | 2.33s | |
| #65 | Gemini 3.1 Flash Lite medium | 1 | 9.1 | $0.117 | 3/4 | 2.39s | |
| #154 | MiMo-V2.5-Pro none | Xiaomi | 1 | 3.3 | $0.068 | 0/4 | 2.67s |
| #148 | Owl Alpha none | Openrouter | 1 | 3.4 | $0.000 | 0/4 | 2.78s |
| #166 | Qwen3 Coder Next none | Qwen | 1 | 3.6 | $0.025 | 0/4 | 3.31s |
| #54 | GPT-5.3 Chat none | OpenAI | 1 | 6.7 | $0.571 | 2/4 | 3.86s |
| #82 | DeepSeek V4 Pro none | DeepSeek | 1 | 3.2 | $0.096 | 0/4 | 4.02s |