编程:答案错误
编程
答案错误
看看哪些 AI 模型在 编程 上最容易遇到 答案错误,更快找出薄弱点。 排序方式: 响应时间(平均) ↓.
265/265
筛选模型
没有模型匹配当前搜索和筛选条件。
| 排名 | 模型 | 公司 | 答案错误 次数 | 分类得分 | 总成本 | 测试正确 | 响应时间(平均) |
|---|---|---|---|---|---|---|---|
| #337 | Granite 4.2 8B high | IBM Granite | 1 | 0.4 | $0.111 | 0/3 | 515.3s |
| #200 | LongCat 2.0 low | Meituan | 1 | 0.7 | $0.630 | 1/3 | 479.3s |
| #186 | Grok 4.7 xhigh | X AI | 1 | 0.5 | $3.398 | 1/3 | 414.5s |
| #190 | Grok 4.7 high | X AI | 1 | 0.6 | $3.037 | 1/3 | 335.9s |
| #291 | North Mini Code medium | Cohere | 3 | 0.4 | $0.000 | 0/3 | 320.4s |
| #144 | Grok 4.7 medium | X AI | 1 | 0.7 | $2.938 | 1/3 | 312.2s |
| #215 | Solar Pro 4 medium | Upstage | 1 | 0.5 | $0.098 | 1/3 | 310.4s |
| #274 | Dots 3 Note Preview medium | Dots Studio | 1 | 0.4 | $0.000 | 0/3 | 309.1s |
| #185 | Solar Pro 4 xhigh | Upstage | 1 | 0.6 | $0.067 | 1/3 | 292.2s |
| #334 | Nemotron 3.5 Lightning medium | NVIDIA | 3 | 0.4 | $0.195 | 0/3 | 285.5s |
| #131 | Seed-2.0-Code high | Bytedance Seed | 1 | 0.6 | $1.448 | 1/3 | 266.7s |
| #189 | Solar Pro 4 low | Upstage | 1 | 0.5 | $0.101 | 1/3 | 259.6s |
| #77 | DeepSeek V4 Flash 0731 high | DeepSeek | 1 | 0.6 | $0.576 | 1/3 | 252.7s |
| #234 | DeepSeek V3.2 medium | DeepSeek | 1 | 0.6 | $0.152 | 1/3 | 248.7s |
| #269 | Trinity Large Thinking high | Arcee AI | 1 | 0.4 | $0.794 | 0/3 | 245.0s |