编程 排名
看看哪些 AI 模型在 编程 上表现最好,哪些更稳定,以及差距主要出现在哪里。 排序方式: 响应时间(平均) ↓.
408/408
筛选模型
没有模型匹配当前搜索和筛选条件。
| 排名 | 模型 | 公司 | 编程 得分 | 分数 | 总成本 | 测试正确 | 响应时间(平均) |
|---|---|---|---|---|---|---|---|
| #45 | GLM 5.3 Flash max | Z.ai | 1.0 | 0.9 | $0.089 | 3/3 | 43.4s |
| #133 | Qwen3.6 Flash medium | Qwen | 0.5 | 0.7 | $0.783 | 0/3 | 42.9s |
| #122 | Qwen3.7 Flash low | Qwen | 0.7 | 0.8 | $0.071 | 1/3 | 42.4s |
| #272 | GPT-5 Nano medium | OpenAI | 0.7 | 0.6 | $0.159 | 1/3 | 41.6s |
| #32 | Qwen3.8 MAX medium | Qwen | 1.0 | 0.9 | $1.181 | 3/3 | 41.3s |
| #212 | Grok 4.3 medium | X AI | 0.6 | 0.6 | $0.989 | 1/3 | 41.2s |
| #41 | Muse Spark 1.3 medium | Meta | 1.0 | 0.9 | $1.712 | 3/3 | 41.1s |
| #145 | Gemini 2.5 Flash medium | 0.8 | 0.7 | $0.680 | 2/3 | 41.0s | |
| #88 | GLM 5.2 medium | Z.ai | 0.8 | 0.8 | $1.007 | 2/3 | 41.0s |
| #95 | DeepSeek V4.1 Flash low | DeepSeek | 1.0 | 0.8 | $0.494 | 3/3 | 40.7s |
| #151 | Qwen3.8 27B medium | Qwen | 1.0 | 0.7 | ~$0.073 | 3/3 | 40.5s |
| #74 | Gemini 3.1 Pro Preview medium | 0.8 | 0.8 | $1.585 | 2/3 | 40.2s | |
| #312 | Mistral Small 4 medium | Mistral | 0.4 | 0.5 | $0.126 | 0/3 | 40.0s |
| #309 | KAT Coder AIR V2.5 high | Kwaipilot | 0.4 | 0.5 | $0.077 | 0/3 | 39.1s |
| #260 | gpt-oss-120b medium | OpenAI | 0.6 | 0.6 | $0.030 | 1/3 | 38.4s |