答案错误 失败
看看哪些 AI 模型最常遇到 答案错误,让你在选择前先发现稳定性风险。 排序方式: 失败次数 ↑.
313/313
筛选模型
没有模型匹配当前搜索和筛选条件。
| 排名 | 模型 | 公司 | 答案错误 次数 | 分数 | 总成本 | 测试正确 | 响应时间(平均) |
|---|---|---|---|---|---|---|---|
| #314 | Nemotron 3 Nano Omni 30b A3b Reasoning none | NVIDIA | 9 | 3.2 | $0.000 | 2/19 | 728ms |
| #316 | LFM2-24B-A2B none | Liquid | 9 | 2.2 | $0.001 | 2/16 | 782ms |
| #115 | KAT-Coder-Pro V2.5 low | Kwaipilot | 10 | 7.3 | $0.400 | 11/22 | 20.2s |
| #122 | KAT-Coder-Pro V2.5 high | Kwaipilot | 10 | 7.2 | $0.506 | 11/22 | 22.1s |
| #135 | GPT-5.5 none | OpenAI | 10 | 7.0 | $0.544 | 12/22 | 2.35s |
| #156 | KAT-Coder-Pro V2.5 none | Kwaipilot | 10 | 6.7 | $0.487 | 11/22 | 26.0s |
| #171 | Laguna XS 2.1 medium | Poolside | 10 | 6.5 | $0.068 | 9/22 | 48.2s |
| #185 | GPT-5.6 Luna low | OpenAI | 10 | 6.2 | $0.051 | 10/22 | 5.20s |
| #196 | Gemma 4 31B none | 10 | 6.1 | $0.016 | 9/22 | 5.41s | |
| #204 | GPT-5 Nano medium | OpenAI | 10 | 6.0 | $0.118 | 8/22 | 54.2s |
| #227 | Owl Alpha medium | Openrouter | 10 | 5.6 | $0.000 | 8/21 | 11.9s |
| #230 | Owl Alpha none | Openrouter | 10 | 5.6 | $0.000 | 7/21 | 9.88s |
| #231 | KAT-Coder-Air V2.5 medium | Kwaipilot | 10 | 5.6 | $0.048 | 8/22 | 8.65s |
| #237 | Mimo V2 Omni none | Xiaomi | 10 | 5.5 | $0.021 | 8/21 | 2.44s |
| #258 | Granite 4.2 8B low | IBM Granite | 10 | 5.1 | $0.012 | 7/22 | 54.4s |