Agentic: Wrong answer
Agentic
Wrong answer
See which AI models are most likely to hit Wrong answer on Agentic, so you can spot weak points faster. Sort by: Total Cost ↓.
Failure Reasons
108/108
Filter models
No models match the current search and filters.
| Rank | Model | Company | Wrong answer Count | Category Score | Total Cost | Tests Correct | Response Time (avg) |
|---|---|---|---|---|---|---|---|
| #142 | Claude Opus 4.8 low | Anthropic | 1 | 4.7 | $3.787 | 0/1 | 110.7s |
| #134 | Grok 4.7 medium | X AI | 1 | 3.9 | $3.501 | 0/1 | 372.1s |
| #78 | Claude Opus 4.8 medium | Anthropic | 1 | 6.1 | $3.490 | 0/1 | 99.4s |
| #149 | Claude Opus 5 none | Anthropic | 1 | 5.4 | $2.766 | 0/1 | 79.6s |
| #62 | Grok 4.6 high | X AI | 1 | 5.0 | $2.629 | 0/1 | 160.9s |
| #80 | Grok 4.5 high | X AI | 1 | 5.0 | $2.571 | 0/1 | 77.0s |
| #102 | Grok 4.5 medium | X AI | 1 | 5.0 | $2.454 | 0/1 | 65.2s |
| #162 | Claude Opus 4.8 none | Anthropic | 1 | 5.4 | $2.328 | 0/1 | 69.1s |
| #105 | Grok 4.6 medium | X AI | 1 | 5.0 | $2.270 | 0/1 | 103.6s |
| #127 | Grok 4.7 low | X AI | 1 | 5.0 | $2.263 | 0/1 | 154.9s |
| #65 | Qwen3.7 Max medium | Qwen | 1 | 6.1 | $2.046 | 0/1 | 137.0s |
| #224 | Grok 4.20 medium | X AI | 1 | 3.0 | $1.582 | 0/1 | 128.3s |
| #189 | Step 3.7 Flash high | Stepfun | 1 | 5.4 | $1.350 | 0/1 | 130.4s |
| #108 | Grok 4.5 low | X AI | 1 | 5.0 | $1.345 | 0/1 | 61.5s |
| #168 | Kimi K2.6 medium | Moonshot AI | 1 | 5.0 | $1.323 | 0/1 | 233.9s |