指令遵循 排名
看看哪些 AI 模型在 指令遵循 上表现最好,哪些更稳定,以及差距主要出现在哪里。
311/311
筛选模型
没有模型匹配当前搜索和筛选条件。
| 排名 | 模型 | 公司 | 指令遵循 得分 | 分数 | 总成本 | 测试正确 | 响应时间(平均) |
|---|---|---|---|---|---|---|---|
| #130 | GPT-5.5 none | OpenAI | 6.2 | 7.0 | $0.544 | 1/2 | 1.15s |
| #192 | Qwen3.5 Plus 2026-04-20 none | Qwen | 6.2 | 6.1 | $0.122 | 1/2 | 1.17s |
| #243 | Seed-2.0-Code none | Bytedance Seed | 6.2 | 5.3 | $0.151 | 1/2 | 1.80s |
| #246 | Qwen3.6 35B A3B none | Qwen | 6.2 | 5.3 | $0.051 | 1/2 | 1.86s |
| #289 | GLM 4.7 Flash medium | Z.ai | 6.2 | 4.3 | $0.168 | 1/2 | 2.97s |
| #137 | Qwen3.7 Flash medium | Qwen | 5.8 | 6.9 | $0.065 | 0/2 | 9.27s |
| #239 | DeepSeek V4 Flash 0731 none | DeepSeek | 5.0 | 5.4 | $0.011 | 0/2 | 1.42s |
| #310 | Step 3.5 Flash none | Stepfun | 5.0 | 2.3 | $0.020 | 1/1 | 9.30s |
| #215 | Ling-3.0-flash none | Inclusionai | 4.8 | 5.7 | $0.004 | 0/2 | 836ms |
| #247 | Dots 3 Note Preview none | Dots Studio | 4.8 | 5.2 | $0.000 | 0/2 | 1.06s |
| #309 | Nemotron 3 Nano Omni 30b A3b Reasoning none | NVIDIA | 4.8 | 3.2 | $0.000 | 0/2 | 541ms |
| #240 | Laguna S 2.1 high | Poolside | 4.6 | 5.4 | $0.114 | 0/2 | 453ms |
| #189 | Trinity Large Thinking medium | Arcee AI | 4.4 | 6.1 | $0.756 | 0/2 | 3.99s |
| #194 | Trinity Large Thinking low | Arcee AI | 4.4 | 6.0 | $0.625 | 0/2 | 4.07s |
| #285 | Laguna S 2.1 none | Poolside | 4.3 | 4.5 | $0.022 | 0/2 | 566ms |