AI BENCHY Failures
Wrong answer Failures
See which AI models run into Wrong answer most often, so you can spot reliability risks before choosing one.
Categories
197/197
Filter models
No models match the current search and filters.
| Rank | Model | Company | Wrong answer Count | Score | Total Cost | Tests Correct | Response Time (avg) |
|---|---|---|---|---|---|---|---|
| #166 | Laguna M.1 medium | Poolside | 4 | 5.0 | $0.033 | 9/19 | 14.7s |
| #4 | Qwen3.7 Max medium | Qwen | 3 | 9.4 | $0.616 | 18/21 | 16.0s |
| #7 | GPT-5.5 low | OpenAI | 3 | 9.3 | $0.907 | 18/21 | 9.76s |
| #15 | Claude Opus 4.8 medium | Anthropic | 3 | 8.8 | $1.107 | 17/21 | 9.72s |
| #16 | Claude Opus 4.7 medium | Anthropic | 3 | 8.7 | $0.679 | 17/21 | 4.73s |
| #17 | GLM 5.2 medium | Z.ai | 3 | 8.7 | $0.216 | 15/21 | 23.3s |
| #18 | GLM 5 medium | Z.ai | 3 | 8.6 | $0.372 | 15/21 | 33.5s |
| #26 | GPT-5.2 medium | OpenAI | 3 | 8.4 | $0.548 | 13/21 | 16.9s |
| #33 | GLM 5.2 high | Z.ai | 3 | 8.0 | $0.671 | 13/21 | 37.1s |
| #46 | Kimi K2.6 medium | Moonshot AI | 3 | 7.8 | $1.047 | 12/21 | 71.7s |
| #51 | Claude Opus 4.6 medium | Anthropic | 3 | 7.7 | $2.053 | 12/21 | 25.9s |
| #55 | MiniMax M3 medium | Minimax | 3 | 7.6 | $0.131 | 11/21 | 68.2s |
| #66 | Claude Opus 4.7 none | Anthropic | 3 | 7.4 | $0.505 | 16/19 | 3.02s |
| #68 | MiMo-V2.5-Pro medium | Xiaomi | 3 | 7.4 | $0.106 | 12/21 | 26.1s |
| #71 | Hy3 preview medium | Tencent | 3 | 7.3 | $0.018 | 14/21 | 16.3s |