编程 排名
看看哪些 AI 模型在 编程 上表现最好,哪些更稳定,以及差距主要出现在哪里。 排序方式: 测试正确 ↑.
408/408
筛选模型
没有模型匹配当前搜索和筛选条件。
| 排名 | 模型 | 公司 | 编程 得分 | 分数 | 总成本 | 测试正确 | 响应时间(平均) |
|---|---|---|---|---|---|---|---|
| #308 | Nemotron 3.5 Lightning high | NVIDIA | 0.4 | 0.5 | $0.168 | 0/3 | 168.4s |
| #309 | KAT Coder AIR V2.5 high | Kwaipilot | 0.4 | 0.5 | $0.077 | 0/3 | 39.1s |
| #312 | Mistral Small 4 medium | Mistral | 0.4 | 0.5 | $0.126 | 0/3 | 40.0s |
| #313 | Mistral Small 4 none | Mistral | 0.4 | 0.5 | $0.047 | 0/3 | 901ms |
| #315 | KAT Coder AIR V2.5 medium | Kwaipilot | 0.4 | 0.5 | $0.048 | 0/3 | 23.4s |
| #316 | MiMo-V2.5-Pro none | Xiaomi | 0.4 | 0.5 | $0.135 | 0/3 | 1.41s |
| #317 | Apodex 1.1 Mini default | Apodex | 0.4 | 0.5 | $0.000 | 0/3 | 1.13s |
| #321 | Dots 3 Note Preview default | Dots Studio | 0.5 | 0.5 | $0.000 | 0/3 | 6.12s |
| #322 | GPT-4o-mini default | OpenAI | 0.3 | 0.5 | $0.024 | 0/3 | 1.63s |
| #323 | KAT Coder AIR V2.5 low | Kwaipilot | 0.3 | 0.5 | $0.046 | 0/3 | 11.1s |
| #325 | Inkling Small none | Thinkingmachines | 0.4 | 0.5 | $0.054 | 0/3 | 759ms |
| #326 | Qwen3 Coder Next default | Qwen | 0.5 | 0.5 | $0.067 | 0/3 | 2.22s |
| #328 | Gemini 3 PRO Preview medium | 0.3 | 0.5 | $0.385 | 0/3 | 0ms | |
| #329 | Ling 2.6 1t default | Inclusionai | 0.4 | 0.5 | $0.016 | 0/3 | 10.6s |
| #331 | Qwen3.5-9B none | Qwen | 0.4 | 0.5 | $0.041 | 0/3 | 5.60s |