Coding: Wrong answer
Coding
Wrong answer
See which AI models are most likely to hit Wrong answer on Coding, so you can spot weak points faster. Sort by: Total Cost ↑.
Failure Reasons
265/265
Filter models
No models match the current search and filters.
| Rank | Model | Company | Wrong answer Count | Category Score | Total Cost | Tests Correct | Response Time (avg) |
|---|---|---|---|---|---|---|---|
| #79 | GPT-5.6 Terra high | OpenAI | 1 | 0.8 | $0.698 | 2/3 | 9.14s |
| #18 | GPT-6 Sol medium | OpenAI | 1 | 0.8 | $0.703 | 2/3 | 11.8s |
| #224 | Qwen3.5-35B-A3B medium | Qwen | 1 | 0.6 | $0.716 | 1/3 | 206.6s |
| #228 | Gemini 3.1 Flash Lite low | 2 | 0.5 | $0.717 | 1/3 | 1.53s | |
| #227 | Gemini 3.1 Flash Lite Preview low | 2 | 0.5 | $0.736 | 1/3 | 1.39s | |
| #250 | KAT-Coder-Pro V2.5 default | Kwaipilot | 2 | 0.6 | $0.742 | 1/3 | 22.5s |
| #39 | Gemini 3.5 Flash low | 1 | 0.8 | $0.752 | 2/3 | 6.71s | |
| #99 | Gemini 3.8 Flash medium | 1 | 0.8 | $0.769 | 2/3 | 11.7s | |
| #170 | Grok 4.6 low | X AI | 2 | 0.6 | $0.781 | 1/3 | 21.7s |
| #133 | Qwen3.6 Flash medium | Qwen | 3 | 0.5 | $0.783 | 0/3 | 42.9s |
| #295 | Ember-1 none | Fireworks | 2 | 0.5 | $0.786 | 1/3 | 1.94s |
| #269 | Trinity Large Thinking high | Arcee AI | 1 | 0.4 | $0.794 | 0/3 | 245.0s |
| #194 | GPT-5.6 Sol none | OpenAI | 2 | 0.5 | $0.795 | 1/3 | 1.39s |
| #15 | Gemini 3 Flash Preview medium | 1 | 0.9 | $0.876 | 2/3 | 84.4s | |
| #91 | Seed-2.0-Code low | Bytedance Seed | 2 | 0.7 | $0.881 | 1/3 | 109.7s |