编程 排名
看看哪些 AI 模型在 编程 上表现最好,哪些更稳定,以及差距主要出现在哪里。 排序方式: 总成本 ↑.
408/408
筛选模型
没有模型匹配当前搜索和筛选条件。
| 排名 | 模型 | 公司 | 编程 得分 | 分数 | 总成本 | 测试正确 | 响应时间(平均) |
|---|---|---|---|---|---|---|---|
| #251 | Granite 4.2 8B medium | IBM Granite | 0.5 | 0.6 | $0.029 | 1/3 | 12.1s |
| #260 | gpt-oss-120b medium | OpenAI | 0.6 | 0.6 | $0.030 | 1/3 | 38.4s |
| #289 | Gemma 4 26B A4B none | 0.4 | 0.5 | $0.031 | 0/3 | 4.16s | |
| #277 | Gemma 4 31B none | 0.5 | 0.6 | $0.031 | 1/3 | 11.2s | |
| #125 | GPT-6 Luna low | OpenAI | 0.6 | 0.8 | $0.033 | 1/3 | 15.4s |
| #372 | Laguna M.1 medium | Poolside | 0.1 | 0.4 | $0.033 | 0/1 | 35.6s |
| #360 | Mercury 2 none | Inception | 0.3 | 0.4 | $0.033 | 0/3 | 1.03s |
| #219 | Mercury 2.5 medium | Inception | 0.5 | 0.6 | $0.034 | 0/3 | 3.70s |
| #301 | Granite 4.2 8B low | IBM Granite | 0.5 | 0.5 | $0.036 | 1/3 | 13.0s |
| #358 | Granite 4.2 8B none | IBM Granite | 0.5 | 0.4 | $0.037 | 1/3 | 105.6s |
| #197 | GLM 5.3 Flash low | Z.ai | 0.5 | 0.7 | $0.038 | 1/3 | 10.4s |
| #183 | Mercury 2.5 Preview medium | Inception | 0.8 | 0.7 | $0.039 | 2/3 | 3.86s |
| #207 | Mercury 2.5 Preview high | Inception | 0.7 | 0.6 | $0.040 | 1/3 | 6.13s |
| #331 | Qwen3.5-9B none | Qwen | 0.4 | 0.5 | $0.041 | 0/3 | 5.60s |
| #300 | GPT-5.6 Luna none | OpenAI | 0.4 | 0.5 | $0.042 | 0/3 | 980ms |