编程 排名
看看哪些 AI 模型在 编程 上表现最好,哪些更稳定,以及差距主要出现在哪里。 排序方式: 测试正确 ↑.
408/408
筛选模型
没有模型匹配当前搜索和筛选条件。
| 排名 | 模型 | 公司 | 编程 得分 | 分数 | 总成本 | 测试正确 | 响应时间(平均) |
|---|---|---|---|---|---|---|---|
| #330 | MiMo-V2.5 none | Xiaomi | 0.5 | 0.5 | $0.049 | 1/3 | 3.24s |
| #334 | Hy3 preview high | Tencent | 0.5 | 0.5 | $0.135 | 1/3 | 99.8s |
| #345 | GLM 5V Turbo none | Z.ai | 0.5 | 0.5 | $0.052 | 1/3 | 3.13s |
| #348 | Owl Alpha medium | Openrouter | 0.5 | 0.5 | $0.000 | 1/3 | 18.7s |
| #349 | Mimo V2 PRO default | Xiaomi | 0.5 | 0.5 | $0.045 | 1/3 | 2.65s |
| #350 | Owl Alpha default | Openrouter | 0.6 | 0.5 | $0.000 | 1/3 | 36.9s |
| #351 | Ling 2.6 Flash default | Inclusionai | 0.5 | 0.5 | $0.002 | 1/3 | 11.2s |
| #352 | Hy3 preview low | Tencent | 0.5 | 0.5 | $0.042 | 1/3 | 27.9s |
| #353 | Ring 2.6 1t default | Inclusionai | 0.5 | 0.4 | $0.026 | 1/3 | 143.8s |
| #358 | Granite 4.2 8B none | IBM Granite | 0.5 | 0.4 | $0.037 | 1/3 | 105.6s |
| #398 | Decider V1.1 27B default | Perplexity | 0.5 | 0.3 | $0.002 | 1/2 | 305ms |
| #400 | Kev 4B default | Jaredpalmer | 0.5 | 0.2 | $0.002 | 1/2 | 771ms |
| #15 | Gemini 3 Flash Preview medium | 0.9 | 1.0 | $0.876 | 2/3 | 84.4s | |
| #17 | Gemini 3.7 Flash medium | 0.8 | 1.0 | $0.278 | 2/3 | 8.86s | |
| #18 | GPT-6 Sol medium | OpenAI | 0.8 | 0.9 | $0.703 | 2/3 | 11.8s |