编程 排名
看看哪些 AI 模型在 编程 上表现最好,哪些更稳定,以及差距主要出现在哪里。 排序方式: 测试正确 ↑.
408/408
筛选模型
没有模型匹配当前搜索和筛选条件。
| 排名 | 模型 | 公司 | 编程 得分 | 分数 | 总成本 | 测试正确 | 响应时间(平均) |
|---|---|---|---|---|---|---|---|
| #128 | GLM 5.1 medium | Z.ai | 0.5 | 0.8 | $1.546 | 0/3 | 109.6s |
| #130 | Mistral Large 4 high | Mistral | 0.3 | 0.8 | $1.391 | 0/3 | 1277.8s |
| #133 | Qwen3.6 Flash medium | Qwen | 0.5 | 0.7 | $0.783 | 0/3 | 42.9s |
| #141 | Gemma 4 26B A4B medium | 0.3 | 0.7 | $0.101 | 0/3 | 272.5s | |
| #169 | Step 5 Preview high | Stepfun | 0.3 | 0.7 | $4.513 | 0/3 | 421.7s |
| #176 | Gemma 4 31B medium | 0.4 | 0.7 | $0.144 | 0/3 | 219.8s | |
| #178 | Claude Sonnet 5.5 low | Anthropic | 0.3 | 0.7 | $0.909 | 0/3 | 5.81s |
| #181 | Qwen3.5-Flash medium | Qwen | 0.4 | 0.7 | $0.184 | 0/3 | 58.9s |
| #182 | Inkling low | Thinkingmachines | 0.5 | 0.7 | $0.293 | 0/3 | 8.71s |
| #196 | Apodex 1.1 Mini high | Apodex | 0.6 | 0.7 | $0.000 | 0/3 | 47.0s |
| #199 | GLM 5.2 none | Z.ai | 0.4 | 0.7 | $0.250 | 0/3 | 7.55s |
| #203 | Step 3.7 Flash high | Stepfun | 0.4 | 0.7 | $1.478 | 0/3 | 206.2s |
| #205 | Claude Sonnet 5.5 medium | Anthropic | 0.3 | 0.7 | $1.100 | 0/3 | 6.07s |
| #210 | GLM 5.1 none | Z.ai | 0.4 | 0.6 | $0.451 | 0/3 | 4.96s |
| #214 | Qwen3.5-122B-A10B none | Qwen | 0.4 | 0.6 | $0.308 | 0/3 | 2.77s |