未遵循指令 失败
看看哪些 AI 模型最常遇到 未遵循指令,让你在选择前先发现稳定性风险。 排序方式: 分数 ↓.
215/215
筛选模型
没有模型匹配当前搜索和筛选条件。
| 排名 | 模型 | 公司 | 未遵循指令 次数 | 分数 | 总成本 | 测试正确 | 响应时间(平均) |
|---|---|---|---|---|---|---|---|
| #187 | Gemini 3.1 Flash Lite minimal | 3 | 6.1 | $0.047 | 10/22 | 1.85s | |
| #189 | gpt-oss-120b medium | OpenAI | 3 | 6.1 | $0.020 | 9/22 | 20.8s |
| #190 | Qwen3.7 Flash none | Qwen | 1 | 6.1 | $0.019 | 7/22 | 10.1s |
| #191 | Gemini 3.1 Flash Lite none | 1 | 6.1 | $0.046 | 9/22 | 1.75s | |
| #192 | Qwen3.5-Flash medium | Qwen | 1 | 6.1 | $0.142 | 11/22 | 84.4s |
| #193 | Inkling low | Thinkingmachines | 2 | 6.1 | $0.187 | 10/22 | 5.11s |
| #194 | Trinity Large Thinking medium | Arcee AI | 4 | 6.1 | $0.756 | 8/22 | 85.4s |
| #195 | Qwen3.6 Flash none | Qwen | 1 | 6.1 | $0.062 | 7/22 | 3.73s |
| #196 | Gemma 4 31B none | 1 | 6.1 | $0.016 | 9/22 | 5.41s | |
| #197 | Qwen3.5 Plus 2026-04-20 none | Qwen | 2 | 6.1 | $0.122 | 8/22 | 13.1s |
| #198 | Nemotron 3 Ultra none | NVIDIA | 1 | 6.1 | $0.093 | 8/22 | 3.88s |
| #199 | Trinity Large Thinking low | Arcee AI | 2 | 6.0 | $0.625 | 8/22 | 96.6s |
| #201 | Grok 4.20 Beta medium | X AI | 1 | 6.0 | $0.750 | 14/18 | 9.75s |
| #202 | GPT-5.6 Terra none | OpenAI | 1 | 6.0 | $0.280 | 8/22 | 1.66s |
| #204 | GPT-5 Nano medium | OpenAI | 2 | 6.0 | $0.118 | 8/22 | 54.2s |