编程 排名
看看哪些 AI 模型在 编程 上表现最好,哪些更稳定,以及差距主要出现在哪里。 排序方式: 总成本 ↓.
408/408
筛选模型
没有模型匹配当前搜索和筛选条件。
| 排名 | 模型 | 公司 | 编程 得分 | 分数 | 总成本 | 测试正确 | 响应时间(平均) |
|---|---|---|---|---|---|---|---|
| #28 | Seed 2.1 Turbo low | Bytedance Seed | 1.0 | 0.9 | $1.645 | 3/3 | 360.8s |
| #21 | GPT-5.6 Sol high | OpenAI | 1.0 | 0.9 | $1.595 | 3/3 | 12.5s |
| #180 | Kimi K2.6 medium | Moonshot AI | 0.6 | 0.7 | $1.594 | 1/3 | 214.4s |
| #47 | Muse Spark 1.2 medium | Meta | 1.0 | 0.9 | $1.590 | 3/3 | 17.5s |
| #74 | Gemini 3.1 Pro Preview medium | 0.8 | 0.8 | $1.585 | 2/3 | 40.2s | |
| #55 | GPT-5.2 medium | OpenAI | 1.0 | 0.9 | $1.558 | 3/3 | 22.7s |
| #128 | GLM 5.1 medium | Z.ai | 0.5 | 0.8 | $1.546 | 0/3 | 109.6s |
| #37 | Pareto default | Unbiased | 1.0 | 0.9 | $1.520 | 3/3 | 50.1s |
| #62 | Claude Sonnet 5.5 xhigh | Anthropic | 0.8 | 0.9 | $1.516 | 2/3 | 11.9s |
| #168 | Ember-1 low | Fireworks | 1.0 | 0.7 | $1.488 | 3/3 | 37.9s |
| #203 | Step 3.7 Flash high | Stepfun | 0.4 | 0.7 | $1.478 | 0/3 | 206.2s |
| #131 | Seed-2.0-Code high | Bytedance Seed | 0.6 | 0.7 | $1.448 | 1/3 | 266.7s |
| #68 | Claude Sonnet 5 medium | Anthropic | 0.9 | 0.9 | $1.438 | 2/3 | 17.3s |
| #188 | Grok Build 0.1 medium | X AI | 0.6 | 0.7 | $1.419 | 1/3 | 108.5s |
| #130 | Mistral Large 4 high | Mistral | 0.3 | 0.8 | $1.391 | 0/3 | 1277.8s |