未遵循指令 失败
看看哪些 AI 模型最常遇到 未遵循指令,让你在选择前先发现稳定性风险。 排序方式: 响应时间(平均) ↓.
215/215
筛选模型
没有模型匹配当前搜索和筛选条件。
| 排名 | 模型 | 公司 | 未遵循指令 次数 | 分数 | 总成本 | 测试正确 | 响应时间(平均) |
|---|---|---|---|---|---|---|---|
| #268 | GPT-4o-mini none | OpenAI | 1 | 5.0 | $0.010 | 5/22 | 1.92s |
| #187 | Gemini 3.1 Flash Lite minimal | 3 | 6.1 | $0.047 | 10/22 | 1.85s | |
| #191 | Gemini 3.1 Flash Lite none | 1 | 6.1 | $0.046 | 9/22 | 1.75s | |
| #202 | GPT-5.6 Terra none | OpenAI | 1 | 6.0 | $0.280 | 8/22 | 1.66s |
| #308 | Grok 4.1 Fast none | X AI | 3 | 3.8 | $0.008 | 3/19 | 1.62s |
| #212 | GPT-5.4 Mini none | OpenAI | 3 | 5.9 | $0.095 | 6/22 | 1.58s |
| #173 | Gemini 3.1 Flash Lite Preview none | 2 | 6.4 | $0.052 | 12/22 | 1.56s | |
| #247 | Laguna XS 2.1 none | Poolside | 1 | 5.3 | $0.008 | 5/22 | 1.55s |
| #246 | Inkling Small none | Thinkingmachines | 1 | 5.3 | $0.054 | 5/22 | 1.51s |
| #303 | Granite 4.1 8B none | IBM Granite | 4 | 4.0 | $0.007 | 2/22 | 1.44s |
| #265 | Mercury 2.5 Preview low | Inception | 2 | 5.0 | $0.011 | 6/22 | 1.31s |
| #295 | Elephant Alpha medium | Openrouter | 2 | 4.3 | $0.000 | 6/21 | 1.27s |
| #293 | Elephant Alpha none | Openrouter | 3 | 4.3 | $0.000 | 5/21 | 1.22s |
| #304 | Nemotron 3.5 Lightning none | NVIDIA | 1 | 4.0 | $0.007 | 3/22 | 1.21s |
| #256 | Mistral Small 4 none | Mistral | 1 | 5.1 | $0.022 | 5/22 | 1.20s |