Coding: Wrong answer
Coding
Wrong answer
See which AI models are most likely to hit Wrong answer on Coding, so you can spot weak points faster. Sort by: Response Time (avg) ↑.
Failure Reasons
265/265
Filter models
No models match the current search and filters.
| Rank | Model | Company | Wrong answer Count | Category Score | Total Cost | Tests Correct | Response Time (avg) |
|---|---|---|---|---|---|---|---|
| #120 | Claude Haiku 5.5 medium | Anthropic | 2 | 0.6 | $0.063 | 1/3 | 7.16s |
| #89 | GPT-5.6 Terra medium | OpenAI | 2 | 0.6 | $0.483 | 1/3 | 7.19s |
| #198 | GLM 5.2 none | Z.ai | 2 | 0.4 | $0.250 | 0/3 | 7.55s |
| #153 | Claude Opus 4.8 low | Anthropic | 1 | 0.7 | $3.787 | 1/3 | 7.58s |
| #285 | GPT-6 Luna none | OpenAI | 2 | 0.5 | $0.026 | 1/3 | 8.04s |
| #136 | GLM 5.3 FlashX high | Z.ai | 1 | 0.8 | $0.210 | 2/3 | 8.06s |
| #127 | Space Bunny Alpha high | Stealth | 2 | 0.6 | $0.000 | 1/3 | 8.29s |
| #181 | Inkling low | Thinkingmachines | 3 | 0.5 | $0.293 | 0/3 | 8.71s |
| #59 | GPT-6 Sol low | OpenAI | 2 | 0.6 | $0.477 | 1/3 | 8.74s |
| #302 | Qwen3.6 35B A3B none | Qwen | 2 | 0.5 | $0.105 | 1/3 | 8.77s |
| #17 | Gemini 3.7 Flash medium | 1 | 0.8 | $0.278 | 2/3 | 8.86s | |
| #79 | GPT-5.6 Terra high | OpenAI | 1 | 0.8 | $0.698 | 2/3 | 9.14s |
| #157 | Step 3.7 Flash low | Stepfun | 1 | 0.8 | $0.449 | 2/3 | 9.46s |
| #80 | Claude Haiku 5.5 high | Anthropic | 2 | 0.6 | $0.088 | 1/3 | 9.54s |
| #101 | GPT-5.6 Terra low | OpenAI | 2 | 0.7 | $0.435 | 1/3 | 9.56s |