Coding: Wrong answer
Coding
Wrong answer
See which AI models are most likely to hit Wrong answer on Coding, so you can spot weak points faster. Sort by: Response Time (avg) ↓.
Failure Reasons
265/265
Filter models
No models match the current search and filters.
| Rank | Model | Company | Wrong answer Count | Category Score | Total Cost | Tests Correct | Response Time (avg) |
|---|---|---|---|---|---|---|---|
| #305 | Qwen3.6 35B A3B none | Qwen | 2 | 0.5 | $0.105 | 1/3 | 8.77s |
| #59 | GPT-6 Sol low | OpenAI | 2 | 0.6 | $0.477 | 1/3 | 8.74s |
| #182 | Inkling low | Thinkingmachines | 3 | 0.5 | $0.293 | 0/3 | 8.71s |
| #127 | Space Bunny Alpha high | Stealth | 2 | 0.6 | $0.000 | 1/3 | 8.29s |
| #136 | GLM 5.3 FlashX high | Z.ai | 1 | 0.8 | $0.210 | 2/3 | 8.06s |
| #288 | GPT-6 Luna none | OpenAI | 2 | 0.5 | $0.026 | 1/3 | 8.04s |
| #153 | Claude Opus 4.8 low | Anthropic | 1 | 0.7 | $3.787 | 1/3 | 7.58s |
| #199 | GLM 5.2 none | Z.ai | 2 | 0.4 | $0.250 | 0/3 | 7.55s |
| #89 | GPT-5.6 Terra medium | OpenAI | 2 | 0.6 | $0.483 | 1/3 | 7.19s |
| #120 | Claude Haiku 5.5 medium | Anthropic | 2 | 0.6 | $0.063 | 1/3 | 7.16s |
| #44 | Gemini 3.6 Flash low | 1 | 0.8 | $0.363 | 2/3 | 6.95s | |
| #234 | Space Bunny Alpha medium | Stealth | 2 | 0.5 | $0.000 | 1/3 | 6.82s |
| #39 | Gemini 3.5 Flash low | 1 | 0.8 | $0.752 | 2/3 | 6.71s | |
| #43 | Claude Opus 5 low | Anthropic | 1 | 0.8 | $2.350 | 2/3 | 6.70s |
| #278 | Space Bunny Alpha low | Stealth | 2 | 0.6 | $0.000 | 1/3 | 6.60s |