编程 排名
看看哪些 AI 模型在 编程 上表现最好,哪些更稳定,以及差距主要出现在哪里。 排序方式: 测试正确 ↓.
408/408
筛选模型
没有模型匹配当前搜索和筛选条件。
| 排名 | 模型 | 公司 | 编程 得分 | 分数 | 总成本 | 测试正确 | 响应时间(平均) |
|---|---|---|---|---|---|---|---|
| #387 | Hy3 preview none | Tencent | 0.3 | 0.3 | $0.007 | 0/3 | 4.56s |
| #388 | MiMo-V2-Flash default | Xiaomi | 0.4 | 0.3 | $0.025 | 0/3 | 2.64s |
| #390 | Command A+ high | Cohere | 0.3 | 0.3 | $0.079 | 0/3 | 92.7s |
| #391 | Grok 4.1 Fast default | X AI | 0.2 | 0.3 | $0.008 | 0/1 | 1.79s |
| #392 | Laguna Xs.2 default | Poolside | 0.8 | 0.3 | $0.004 | 0/1 | 1.96s |
| #393 | Command A+ none | Cohere | 0.3 | 0.3 | $0.000 | 0/3 | 80.8s |
| #394 | Command A+ low | Cohere | 0.3 | 0.3 | $0.073 | 0/3 | 86.4s |
| #395 | Nemotron 3 Nano Omni 30b A3b Reasoning medium | NVIDIA | 0.1 | 0.3 | $0.000 | 0/1 | 38.1s |
| #397 | Jev 1.13 default | Typesafe | 0.2 | 0.3 | $0.003 | 0/2 | 598ms |
| #399 | GPT-6 Luna Decisions default | OpenAI | 0.3 | 0.2 | $0.005 | 0/2 | 447ms |
| #401 | Step 3.5 Flash none | Stepfun | 1.0 | 0.2 | $0.020 | 0/1 | 0ms |
| #402 | D1 default | Liquid | 0.2 | 0.2 | $0.003 | 0/2 | 456ms |
| #403 | Gemini 3 Flash Preview high | 0.0 | 0.2 | $0.105 | 0/0 | 0ms | |
| #404 | LFM2-24B-A2B default | Liquid | 0.0 | 0.2 | $0.001 | 0/0 | 0ms |
| #405 | Solar Decide Flash default | Upstage | 0.0 | 0.2 | $0.003 | 0/0 | 0ms |