未遵循指令 失败
看看哪些 AI 模型最常遇到 未遵循指令,让你在选择前先发现稳定性风险。
215/215
筛选模型
没有模型匹配当前搜索和筛选条件。
| 排名 | 模型 | 公司 | 未遵循指令 次数 | 分数 | 总成本 | 测试正确 | 响应时间(平均) |
|---|---|---|---|---|---|---|---|
| #276 | GPT-5.4 Nano none | OpenAI | 2 | 4.8 | $0.041 | 4/22 | 2.56s |
| #278 | Grok 4.20 Multi Agent Beta medium | X AI | 2 | 4.8 | $5.599 | 8/18 | 9.69s |
| #282 | Hunter Alpha medium | OpenRouter | 2 | 4.7 | $0.000 | 8/18 | 10.3s |
| #294 | GLM 4.7 Flash medium | Z.ai | 2 | 4.3 | $0.168 | 4/22 | 134.3s |
| #295 | Elephant Alpha medium | Openrouter | 2 | 4.3 | $0.000 | 6/21 | 1.27s |
| #297 | Hunter Alpha none | OpenRouter | 2 | 4.2 | $0.000 | 6/18 | 4.70s |
| #301 | MiMo-V2-Flash none | Xiaomi | 2 | 4.0 | $0.025 | 4/21 | 2.76s |
| #305 | Grok Build 0.1 none | X AI | 2 | 4.0 | $0.547 | 7/19 | 28.7s |
| #312 | gpt-oss-120b none | OpenAI | 2 | 3.7 | $0.010 | 6/19 | 21.6s |
| #314 | Nemotron 3 Nano Omni 30b A3b Reasoning none | NVIDIA | 2 | 3.2 | $0.000 | 2/19 | 728ms |
| #26 | Gemini 3.5 Flash medium | 1 | 9.0 | $0.665 | 18/22 | 8.48s | |
| #29 | Grok 4.5 high | X AI | 1 | 9.0 | $2.252 | 17/22 | 72.3s |
| #32 | Seed 2.1 Turbo high | Bytedance Seed | 1 | 8.9 | $1.797 | 16/22 | 174.0s |
| #39 | GLM 5.3 Flash max | Z.ai | 1 | 8.7 | $0.059 | 16/22 | 52.1s |
| #46 | Qwen3.8 Max low | Qwen | 1 | 8.6 | $0.702 | 16/22 | 21.8s |