Agentic: Wrong answer
Agentic
Wrong answer
See which AI models are most likely to hit Wrong answer on Agentic, so you can spot weak points faster. Sort by: Total Cost ↑.
Failure Reasons
108/108
Filter models
No models match the current search and filters.
| Rank | Model | Company | Wrong answer Count | Category Score | Total Cost | Tests Correct | Response Time (avg) |
|---|---|---|---|---|---|---|---|
| #156 | Kimi K2.7 Code medium | Moonshot AI | 1 | 5.0 | $0.861 | 0/1 | 104.0s |
| #246 | Claude Sonnet 5 none | Anthropic | 1 | 4.7 | $1.095 | 0/1 | 64.7s |
| #185 | GPT-5.5 none | OpenAI | 1 | 5.0 | $1.212 | 0/1 | 57.5s |
| #168 | Kimi K2.6 medium | Moonshot AI | 1 | 5.0 | $1.323 | 0/1 | 233.9s |
| #108 | Grok 4.5 low | X AI | 1 | 5.0 | $1.345 | 0/1 | 61.5s |
| #189 | Step 3.7 Flash high | Stepfun | 1 | 5.4 | $1.350 | 0/1 | 130.4s |
| #224 | Grok 4.20 medium | X AI | 1 | 3.0 | $1.582 | 0/1 | 128.3s |
| #65 | Qwen3.7 Max medium | Qwen | 1 | 6.1 | $2.046 | 0/1 | 137.0s |
| #127 | Grok 4.7 low | X AI | 1 | 5.0 | $2.263 | 0/1 | 154.9s |
| #105 | Grok 4.6 medium | X AI | 1 | 5.0 | $2.270 | 0/1 | 103.6s |
| #162 | Claude Opus 4.8 none | Anthropic | 1 | 5.4 | $2.328 | 0/1 | 69.1s |
| #102 | Grok 4.5 medium | X AI | 1 | 5.0 | $2.454 | 0/1 | 65.2s |
| #80 | Grok 4.5 high | X AI | 1 | 5.0 | $2.571 | 0/1 | 77.0s |
| #62 | Grok 4.6 high | X AI | 1 | 5.0 | $2.629 | 0/1 | 160.9s |
| #149 | Claude Opus 5 none | Anthropic | 1 | 5.4 | $2.766 | 0/1 | 79.6s |