未遵循指令 失败
看看哪些 AI 模型最常遇到 未遵循指令,让你在选择前先发现稳定性风险。 排序方式: 测试正确 ↑.
215/215
筛选模型
没有模型匹配当前搜索和筛选条件。
| 排名 | 模型 | 公司 | 未遵循指令 次数 | 分数 | 总成本 | 测试正确 | 响应时间(平均) |
|---|---|---|---|---|---|---|---|
| #150 | DeepSeek V4 Pro none | DeepSeek | 2 | 6.8 | $0.220 | 9/22 | 11.7s |
| #160 | LongCat 2.0 high | Meituan | 2 | 6.7 | $0.492 | 9/22 | 153.3s |
| #163 | Qwen3.5-27B none | Qwen | 2 | 6.6 | $0.058 | 9/22 | 4.77s |
| #189 | gpt-oss-120b medium | OpenAI | 3 | 6.1 | $0.020 | 9/22 | 20.8s |
| #191 | Gemini 3.1 Flash Lite none | 1 | 6.1 | $0.046 | 9/22 | 1.75s | |
| #196 | Gemma 4 31B none | 1 | 6.1 | $0.016 | 9/22 | 5.41s | |
| #219 | Inkling Small low | Thinkingmachines | 2 | 5.7 | $0.055 | 9/22 | 2.07s |
| #228 | Gemma 4 26B A4B none | 2 | 5.6 | $0.015 | 9/22 | 7.58s | |
| #236 | Qwen3.8 27B none | Qwen | 1 | 5.5 | ~$0.006 | 9/22 | 3.12s |
| #274 | Ring-2.6-1T none | Inclusionai | 2 | 4.8 | $0.026 | 9/22 | 52.0s |
| #278 | Grok 4.20 Multi Agent Beta medium | X AI | 2 | 4.8 | $5.599 | 8/18 | 9.69s |
| #282 | Hunter Alpha medium | OpenRouter | 2 | 4.7 | $0.000 | 8/18 | 10.3s |
| #88 | DeepSeek V4 Pro high | DeepSeek | 2 | 7.7 | $0.476 | 10/22 | 92.5s |
| #123 | Muse Glimmer 30B high | Meta | 3 | 7.2 | $0.397 | 10/22 | 66.7s |
| #136 | Mercury 2 medium | Inception | 3 | 7.0 | $0.094 | 10/22 | 2.95s |