Agentic: Wrong answer
Agentic
Wrong answer
See which AI models are most likely to hit Wrong answer on Agentic, so you can spot weak points faster. Sort by: Total Cost ↑.
Failure Reasons
108/108
Filter models
No models match the current search and filters.
| Rank | Model | Company | Wrong answer Count | Category Score | Total Cost | Tests Correct | Response Time (avg) |
|---|---|---|---|---|---|---|---|
| #183 | GPT-5.6 Sol none | OpenAI | 1 | 5.0 | $0.472 | 0/1 | 58.3s |
| #187 | LongCat 2.0 low | Meituan | 1 | 6.1 | $0.495 | 0/1 | 145.6s |
| #209 | MiMo-V2.5-Pro medium | Xiaomi | 1 | 4.7 | $0.502 | 0/1 | 233.5s |
| #208 | Gemini 3.5 Flash minimal | 1 | 5.0 | $0.508 | 0/1 | 49.2s | |
| #249 | GPT-5.6 Terra none | OpenAI | 1 | 5.0 | $0.516 | 0/1 | 58.0s |
| #172 | GPT-6 Sol none | OpenAI | 1 | 5.0 | $0.551 | 0/1 | 57.0s |
| #140 | Qwen3.5 Plus 2026-02-15 medium | Qwen | 1 | 6.1 | $0.567 | 0/1 | 186.4s |
| #144 | LongCat 2.0 medium | Meituan | 1 | 6.1 | $0.593 | 0/1 | 174.1s |
| #260 | GPT-5.4 none | OpenAI | 1 | 5.0 | $0.690 | 0/1 | 43.7s |
| #218 | Gemini 3.1 Flash Lite low | 1 | 5.0 | $0.717 | 0/1 | 80.0s | |
| #216 | Gemini 3.1 Flash Lite Preview low | 1 | 5.0 | $0.736 | 0/1 | 71.3s | |
| #159 | Grok 4.6 low | X AI | 1 | 5.0 | $0.781 | 0/1 | 58.0s |
| #277 | Ember-1 none | Fireworks | 1 | 6.1 | $0.786 | 0/1 | 92.9s |
| #192 | Qwen3.6 35B A3B medium | Qwen | 1 | 6.1 | $0.812 | 0/1 | 88.5s |
| #233 | Trinity Large Thinking medium | Arcee AI | 1 | 6.1 | $0.820 | 0/1 | 52.5s |