编程:答案错误
编程
答案错误
看看哪些 AI 模型在 编程 上最容易遇到 答案错误,更快找出薄弱点。
265/265
筛选模型
没有模型匹配当前搜索和筛选条件。
| 排名 | 模型 | 公司 | 答案错误 次数 | 分类得分 | 总成本 | 测试正确 | 响应时间(平均) |
|---|---|---|---|---|---|---|---|
| #378 | Elephant Alpha default | Openrouter | 1 | 0.4 | $0.000 | 0/3 | 1.39s |
| #379 | Elephant Alpha medium | Openrouter | 1 | 0.4 | $0.000 | 0/3 | 1.30s |
| #381 | Grok 4.20 none | X AI | 1 | 0.1 | $0.057 | 0/1 | 1.22s |
| #383 | Laguna Xs.2 medium | Poolside | 1 | 0.2 | $0.015 | 0/1 | 14.4s |
| #384 | Hy3 preview none | Tencent | 1 | 0.3 | $0.007 | 0/3 | 4.56s |
| #388 | Grok 4.1 Fast default | X AI | 1 | 0.2 | $0.008 | 0/1 | 1.79s |
| #389 | Laguna Xs.2 default | Poolside | 1 | 0.8 | $0.004 | 0/1 | 1.96s |
| #392 | Nemotron 3 Nano Omni 30b A3b Reasoning medium | NVIDIA | 1 | 0.1 | $0.000 | 0/1 | 38.1s |
| #395 | Decider V1.1 27B default | Perplexity | 1 | 0.5 | $0.002 | 1/2 | 305ms |
| #397 | Kev 4B default | Jaredpalmer | 1 | 0.5 | $0.002 | 1/2 | 771ms |