未遵循指令 失败
看看哪些 AI 模型最常遇到 未遵循指令,让你在选择前先发现稳定性风险。 排序方式: 响应时间(平均) ↑.
140/140
筛选模型
没有模型匹配当前搜索和筛选条件。
| 排名 | 模型 | 公司 | 未遵循指令 次数 | 分数 | 总成本 | 测试正确 | 响应时间(平均) |
|---|---|---|---|---|---|---|---|
| #28 | Inkling high | Thinkingmachines | 1 | 8.0 | $1.006 | 15/22 | 64.2s |
| #163 | Gemini 3.1 Flash Lite Preview high | 1 | 5.3 | $2.310 | 13/16 | 68.1s | |
| #190 | MiniMax M2.5 medium | Minimax | 3 | 4.6 | $0.340 | 5/22 | 68.3s |
| #76 | DeepSeek V3.2 medium | DeepSeek | 1 | 7.0 | $0.078 | 11/22 | 68.6s |
| #108 | Ring-2.6-1T medium | Inclusionai | 2 | 6.3 | $0.103 | 11/22 | 68.7s |
| #47 | MiniMax M3 medium | Minimax | 2 | 7.6 | $0.286 | 12/22 | 75.0s |
| #12 | Grok 4.5 high | X AI | 1 | 8.9 | $1.707 | 17/22 | 76.5s |
| #46 | DeepSeek V4 Pro high | DeepSeek | 2 | 7.7 | $0.200 | 10/22 | 79.1s |
| #204 | Qwen3.5-9B medium | Qwen | 1 | 3.8 | $0.036 | 3/22 | 82.2s |
| #52 | Kimi K2.7 Code medium | Moonshot AI | 1 | 7.5 | $0.751 | 12/22 | 84.2s |
| #114 | Qwen3.5-Flash medium | Qwen | 1 | 6.2 | $0.139 | 12/22 | 84.8s |
| #80 | Seed-2.0-Mini medium | Bytedance Seed | 1 | 7.0 | $0.101 | 11/22 | 92.5s |
| #77 | Kimi K2.5 medium | Moonshot AI | 2 | 7.0 | $0.600 | 10/22 | 99.0s |
| #91 | LongCat 2.0 low | Meituan | 1 | 6.7 | $0.391 | 10/22 | 100.3s |
| #99 | Qwen3.6 27B medium | Qwen | 1 | 6.5 | $0.779 | 10/22 | 106.3s |