指令遵循 排名
看看哪些 AI 模型在 指令遵循 上表现最好,哪些更稳定,以及差距主要出现在哪里。
216/216
筛选模型
没有模型匹配当前搜索和筛选条件。
| 排名 | 模型 | 公司 | 指令遵循 得分 | 分数 | 总成本 | 测试正确 | 响应时间(平均) |
|---|---|---|---|---|---|---|---|
| #32 | Inkling high | Thinkingmachines | 9.8 | 8.0 | $1.006 | 2/2 | 7.00s |
| #45 | Claude Opus 4.8 low | Anthropic | 9.8 | 7.8 | $2.077 | 2/2 | 2.78s |
| #51 | MiniMax M3 medium | Minimax | 9.8 | 7.6 | $0.286 | 2/2 | 6.14s |
| #52 | Grok Build 0.1 medium | X AI | 9.8 | 7.6 | $1.097 | 2/2 | 12.4s |
| #57 | GPT-5.4 Nano medium | OpenAI | 9.8 | 7.5 | $0.138 | 2/2 | 1.88s |
| #77 | Grok 4.3 medium | X AI | 9.8 | 7.1 | $0.779 | 2/2 | 18.6s |
| #83 | Gemini 3.5 Flash none | 9.8 | 7.0 | $1.079 | 2/2 | 3.38s | |
| #97 | KAT-Coder-Pro V2.5 none | Kwaipilot | 9.8 | 6.7 | $0.476 | 2/2 | 2.61s |
| #150 | KAT-Coder-Air V2.5 high | Kwaipilot | 9.8 | 5.6 | $0.077 | 2/2 | 1.51s |
| #164 | KAT-Coder-Air V2.5 low | Kwaipilot | 9.8 | 5.4 | $0.041 | 2/2 | 1.64s |
| #184 | Ling-2.6-flash none | Inclusionai | 9.8 | 4.9 | $0.002 | 2/2 | 5.52s |
| #194 | Cobuddy medium | Baidu | 9.8 | 4.7 | $0.000 | 2/2 | 11.6s |
| #199 | Elephant Alpha none | Openrouter | 9.8 | 4.3 | $0.000 | 2/2 | 1.03s |
| #201 | Elephant Alpha medium | Openrouter | 9.8 | 4.3 | $0.000 | 2/2 | 987ms |
| #15 | Grok 4.5 high | X AI | 9.8 | 8.9 | $1.707 | 2/2 | 6.23s |