编程 排名
看看哪些 AI 模型在 编程 上表现最好,哪些更稳定,以及差距主要出现在哪里。 排序方式: 总成本 ↓.
408/408
筛选模型
没有模型匹配当前搜索和筛选条件。
| 排名 | 模型 | 公司 | 编程 得分 | 分数 | 总成本 | 测试正确 | 响应时间(平均) |
|---|---|---|---|---|---|---|---|
| #84 | Claude Opus 4.8 medium | Anthropic | 1.0 | 0.8 | $3.490 | 3/3 | 15.3s |
| #104 | Claude Fable 5.1 high | Anthropic | 0.8 | 0.8 | $3.471 | 2/3 | 13.9s |
| #82 | Kimi K3 max | Moonshot AI | 1.0 | 0.8 | $3.409 | 3/3 | 325.8s |
| #187 | Grok 4.7 xhigh | X AI | 0.5 | 0.7 | $3.398 | 1/3 | 414.5s |
| #244 | Claude Fable 5.1 low | Anthropic | 0.3 | 0.6 | $3.395 | 0/3 | 6.75s |
| #33 | Qwen3.8 Max (0902) high | Qwen | 1.0 | 0.9 | $3.306 | 3/3 | 253.2s |
| #193 | Ember-1 max | Fireworks | 0.5 | 0.7 | $3.264 | 1/3 | 105.1s |
| #143 | Claude Fable 5.1 medium | Anthropic | 0.7 | 0.7 | $3.197 | 1/3 | 11.0s |
| #191 | Grok 4.7 high | X AI | 0.6 | 0.7 | $3.037 | 1/3 | 335.9s |
| #111 | Grok 4.5 medium | X AI | 0.8 | 0.8 | $2.996 | 2/3 | 155.7s |
| #233 | Claude Opus 4.6 medium | Anthropic | 0.6 | 0.6 | $2.961 | 1/3 | 30.1s |
| #108 | Qwen3.8 2.4T A95B high | Qwen | 0.6 | 0.8 | $2.949 | 1/3 | 160.5s |
| #144 | Grok 4.7 medium | X AI | 0.7 | 0.7 | $2.938 | 1/3 | 312.2s |
| #27 | Claude Opus 5 medium | Anthropic | 1.0 | 0.9 | $2.870 | 3/3 | 9.56s |
| #159 | Claude Opus 5 none | Anthropic | 0.6 | 0.7 | $2.766 | 1/3 | 5.54s |