答案错误 失败
看看哪些 AI 模型最常遇到 答案错误,让你在选择前先发现稳定性风险。
209/209
筛选模型
没有模型匹配当前搜索和筛选条件。
| 排名 | 模型 | 公司 | 答案错误 次数 | 分数 | 总成本 | 测试正确 | 响应时间(平均) |
|---|---|---|---|---|---|---|---|
| #145 | GLM 5V Turbo none | Z.ai | 11 | 5.6 | $0.052 | 8/21 | 2.99s |
| #147 | Mimo V2 PRO none | Xiaomi | 11 | 5.6 | $0.045 | 7/21 | 2.27s |
| #149 | KAT-Coder-Air V2.5 medium | Kwaipilot | 11 | 5.6 | $0.048 | 8/22 | 8.42s |
| #152 | Qwen3.6 27B none | Qwen | 11 | 5.5 | $0.087 | 7/22 | 10.7s |
| #154 | MiMo-V2.5-Pro none | Xiaomi | 11 | 5.5 | $0.068 | 6/22 | 4.12s |
| #62 | KAT-Coder-Pro V2.5 low | Kwaipilot | 10 | 7.4 | $0.387 | 11/22 | 19.5s |
| #69 | KAT-Coder-Pro V2.5 high | Kwaipilot | 10 | 7.2 | $0.482 | 11/22 | 20.8s |
| #71 | Qwen3.7 Plus none | Qwen | 10 | 7.2 | $0.106 | 11/22 | 12.1s |
| #83 | GPT-5.6 Sol none | OpenAI | 10 | 6.9 | $0.524 | 11/22 | 2.16s |
| #92 | KAT-Coder-Pro V2.5 none | Kwaipilot | 10 | 6.7 | $0.476 | 11/22 | 25.6s |
| #98 | Qwen3.6 Max Preview none | Qwen | 10 | 6.6 | $0.231 | 12/22 | 7.82s |
| #117 | GPT-5.6 Luna low | OpenAI | 10 | 6.2 | $0.249 | 10/22 | 5.04s |
| #146 | Owl Alpha medium | Openrouter | 10 | 5.6 | $0.000 | 8/21 | 11.9s |
| #148 | Owl Alpha none | Openrouter | 10 | 5.6 | $0.000 | 7/21 | 9.88s |
| #156 | Gemma 4 26B A4B none | 10 | 5.5 | $0.015 | 8/22 | 7.64s |