编程 排名
看看哪些 AI 模型在 编程 上表现最好,哪些更稳定,以及差距主要出现在哪里。 排序方式: 测试正确 ↓.
408/408
筛选模型
没有模型匹配当前搜索和筛选条件。
| 排名 | 模型 | 公司 | 编程 得分 | 分数 | 总成本 | 测试正确 | 响应时间(平均) |
|---|---|---|---|---|---|---|---|
| #66 | Grok 4.6 high | X AI | 1.0 | 0.9 | $2.629 | 3/3 | 102.2s |
| #69 | Qwen3.7 Max medium | Qwen | 1.0 | 0.9 | $1.689 | 3/3 | 35.3s |
| #70 | Claude Haiku 5.5 max | Anthropic | 1.0 | 0.8 | $0.509 | 3/3 | 55.9s |
| #72 | GPT-5 Mini medium | OpenAI | 1.0 | 0.8 | $0.315 | 3/3 | 27.6s |
| #73 | Muse Glimmer 30B xhigh | Meta | 1.0 | 0.8 | $0.585 | 3/3 | 105.9s |
| #76 | Muse Spark 1.1 high | Meta | 1.0 | 0.8 | $2.570 | 3/3 | 22.9s |
| #81 | Gemini 3.5 Flash high | 1.0 | 0.8 | $2.737 | 3/3 | 23.0s | |
| #82 | Kimi K3 max | Moonshot AI | 1.0 | 0.8 | $3.409 | 3/3 | 325.8s |
| #84 | Claude Opus 4.8 medium | Anthropic | 1.0 | 0.8 | $3.490 | 3/3 | 15.3s |
| #85 | Ling 3.1 Flash medium | Inclusionai | 1.0 | 0.8 | $0.000 | 3/3 | 87.1s |
| #87 | Grok 4.5 high | X AI | 1.0 | 0.8 | $2.687 | 3/3 | 155.2s |
| #95 | DeepSeek V4.1 Flash low | DeepSeek | 1.0 | 0.8 | $0.494 | 3/3 | 40.7s |
| #100 | Qwen3.8 Flash Next low | Qwen | 1.0 | 0.8 | ~$0.045 | 3/3 | 29.5s |
| #116 | Grok 4.5 low | X AI | 1.0 | 0.8 | $1.345 | 3/3 | 13.7s |
| #124 | Qwen3.8 Flash Next medium | Qwen | 1.0 | 0.8 | ~$0.047 | 3/3 | 45.5s |