编程:答案错误
编程
答案错误
看看哪些 AI 模型在 编程 上最容易遇到 答案错误,更快找出薄弱点。
265/265
筛选模型
没有模型匹配当前搜索和筛选条件。
| 排名 | 模型 | 公司 | 答案错误 次数 | 分类得分 | 总成本 | 测试正确 | 响应时间(平均) |
|---|---|---|---|---|---|---|---|
| #332 | GLM 4.7 Flash none | Z.ai | 3 | 0.4 | $0.027 | 0/3 | 2.54s |
| #333 | Mercury 2.5 Preview default | Inception | 3 | 0.5 | $0.023 | 0/3 | 459ms |
| #334 | Nemotron 3.5 Lightning medium | NVIDIA | 3 | 0.4 | $0.195 | 0/3 | 285.5s |
| #335 | North Mini Code default | Cohere | 3 | 0.4 | $0.000 | 0/3 | 22.0s |
| #336 | Laguna S 2.1 none | Poolside | 3 | 0.3 | $0.044 | 0/3 | 550ms |
| #340 | GPT-5.4 Nano none | OpenAI | 3 | 0.5 | $0.068 | 0/3 | 2.22s |
| #343 | Laguna S 2.1 low | Poolside | 3 | 0.4 | $0.108 | 0/3 | 167.5s |
| #344 | Nemotron 3.5 Lightning low | NVIDIA | 3 | 0.4 | $0.175 | 0/3 | 224.4s |
| #352 | Nemotron 3 Super none | NVIDIA | 3 | 0.3 | $0.016 | 0/3 | 2.64s |
| #357 | Mercury 2 none | Inception | 3 | 0.3 | $0.033 | 0/3 | 1.03s |
| #362 | GLM 5 Turbo none | Z.ai | 3 | 0.4 | $0.047 | 0/3 | 2.41s |
| #370 | Ling 3.0 Tiny default | Inclusionai | 3 | 0.4 | $0.000 | 0/3 | 1.19s |
| #372 | Nemotron 3.5 Lightning none | NVIDIA | 3 | 0.3 | $0.009 | 0/3 | 1.55s |
| #59 | GPT-6 Sol low | OpenAI | 2 | 0.6 | $0.477 | 1/3 | 8.74s |
| #78 | GLM 5.2 high | Z.ai | 2 | 0.6 | $4.632 | 1/3 | 73.0s |