编程 排名
看看哪些 AI 模型在 编程 上表现最好,哪些更稳定,以及差距主要出现在哪里。 排序方式: 测试正确 ↑.
408/408
筛选模型
没有模型匹配当前搜索和筛选条件。
| 排名 | 模型 | 公司 | 编程 得分 | 分数 | 总成本 | 测试正确 | 响应时间(平均) |
|---|---|---|---|---|---|---|---|
| #407 | Tev1 4B Experimental default | Togethercomputer | 0.0 | 1.0 | $0.002 | 0/0 | 0ms |
| #408 | Claude Opus 5.5 none | Anthropic | 0.0 | 0.2 | $0.015 | 0/0 | 0ms |
| #59 | GPT-6 Sol low | OpenAI | 0.6 | 0.9 | $0.477 | 1/3 | 8.74s |
| #77 | DeepSeek V4 Flash 0731 high | DeepSeek | 0.6 | 0.8 | $0.576 | 1/3 | 252.7s |
| #78 | GLM 5.2 high | Z.ai | 0.6 | 0.8 | $4.632 | 1/3 | 73.0s |
| #80 | Claude Haiku 5.5 high | Anthropic | 0.6 | 0.8 | $0.088 | 1/3 | 9.54s |
| #83 | GPT-6 Luna medium | OpenAI | 0.7 | 0.8 | $0.047 | 1/3 | 23.6s |
| #86 | Qwen3.7 Plus medium | Qwen | 0.6 | 0.8 | $0.415 | 1/3 | 108.6s |
| #89 | GPT-5.6 Terra medium | OpenAI | 0.6 | 0.8 | $0.483 | 1/3 | 7.19s |
| #91 | Seed-2.0-Code low | Bytedance Seed | 0.7 | 0.8 | $0.881 | 1/3 | 109.7s |
| #92 | DeepSeek V4 Pro 0423 high | DeepSeek | 0.6 | 0.8 | $0.149 | 1/3 | 243.0s |
| #96 | GPT-5.6 Luna high | OpenAI | 0.5 | 0.8 | $0.118 | 1/3 | 15.6s |
| #98 | GPT-5.4 Nano medium | OpenAI | 0.6 | 0.8 | $0.235 | 1/3 | 19.1s |
| #101 | GPT-5.6 Terra low | OpenAI | 0.7 | 0.8 | $0.435 | 1/3 | 9.56s |
| #102 | Qwen3.5-27B medium | Qwen | 0.6 | 0.8 | $1.135 | 1/3 | 160.7s |