未遵循指令 失败
看看哪些 AI 模型最常遇到 未遵循指令,让你在选择前先发现稳定性风险。
215/215
筛选模型
没有模型匹配当前搜索和筛选条件。
| 排名 | 模型 | 公司 | 未遵循指令 次数 | 分数 | 总成本 | 测试正确 | 响应时间(平均) |
|---|---|---|---|---|---|---|---|
| #121 | Kimi K2.6 medium | Moonshot AI | 2 | 7.2 | $1.247 | 12/22 | 115.9s |
| #131 | Grok 4.3 medium | X AI | 2 | 7.0 | $0.741 | 12/22 | 44.2s |
| #137 | Grok 4.20 medium | X AI | 2 | 7.0 | $0.805 | 11/22 | 32.6s |
| #139 | Kimi K2.5 medium | Moonshot AI | 2 | 7.0 | $0.479 | 10/22 | 98.2s |
| #148 | Solar Pro 4 low | Upstage | 2 | 6.8 | $0.044 | 11/22 | 136.1s |
| #149 | Solar Pro 4 medium | Upstage | 2 | 6.8 | $0.047 | 12/22 | 127.6s |
| #150 | DeepSeek V4 Pro none | DeepSeek | 2 | 6.8 | $0.220 | 9/22 | 11.7s |
| #152 | MiMo-V2.5-Pro medium | Xiaomi | 2 | 6.8 | $0.221 | 11/22 | 48.7s |
| #160 | LongCat 2.0 high | Meituan | 2 | 6.7 | $0.492 | 9/22 | 153.3s |
| #163 | Qwen3.5-27B none | Qwen | 2 | 6.6 | $0.058 | 9/22 | 4.77s |
| #168 | Mercury 2.5 Preview high | Inception | 2 | 6.6 | $0.030 | 12/22 | 4.01s |
| #173 | Gemini 3.1 Flash Lite Preview none | 2 | 6.4 | $0.052 | 12/22 | 1.56s | |
| #175 | Dots 3 Note Preview low | Dots Studio | 2 | 6.4 | $0.000 | 10/22 | 61.8s |
| #180 | Ring-2.6-1T medium | Inclusionai | 2 | 6.4 | $0.102 | 11/22 | 68.8s |
| #193 | Inkling low | Thinkingmachines | 2 | 6.1 | $0.187 | 10/22 | 5.11s |