Agentic: Wrong answer
Agentic
Wrong answer
See which AI models are most likely to hit Wrong answer on Agentic, so you can spot weak points faster. Sort by: Response Time (avg) ↑.
Failure Reasons
108/108
Filter models
No models match the current search and filters.
| Rank | Model | Company | Wrong answer Count | Category Score | Total Cost | Tests Correct | Response Time (avg) |
|---|---|---|---|---|---|---|---|
| #242 | Gemini 3.1 Flash Lite minimal | 1 | 5.0 | $0.080 | 0/1 | 50.0s | |
| #233 | Trinity Large Thinking medium | Arcee AI | 1 | 6.1 | $0.820 | 0/1 | 52.5s |
| #160 | Gemini 3 Flash Preview low | 1 | 5.0 | $0.254 | 0/1 | 52.6s | |
| #279 | GPT-5.6 Luna none | OpenAI | 1 | 5.0 | $0.056 | 0/1 | 53.8s |
| #215 | Gemini 3.5 Flash Lite low | 1 | 5.0 | $0.183 | 0/1 | 53.9s | |
| #291 | Mistral Small 4 medium | Mistral | 1 | 5.0 | $0.126 | 0/1 | 54.1s |
| #155 | Gemini 3.1 Flash Lite Preview medium | 1 | 5.0 | $0.158 | 0/1 | 54.9s | |
| #90 | DeepSeek V4.1 Flash low | DeepSeek | 1 | 6.1 | $0.153 | 0/1 | 56.0s |
| #172 | GPT-6 Sol none | OpenAI | 1 | 5.0 | $0.551 | 0/1 | 57.0s |
| #185 | GPT-5.5 none | OpenAI | 1 | 5.0 | $1.212 | 0/1 | 57.5s |
| #202 | Gemini 3 Flash Preview none | 1 | 5.0 | $0.155 | 0/1 | 57.8s | |
| #159 | Grok 4.6 low | X AI | 1 | 5.0 | $0.781 | 0/1 | 58.0s |
| #249 | GPT-5.6 Terra none | OpenAI | 1 | 5.0 | $0.516 | 0/1 | 58.0s |
| #183 | GPT-5.6 Sol none | OpenAI | 1 | 5.0 | $0.472 | 0/1 | 58.3s |
| #108 | Grok 4.5 low | X AI | 1 | 5.0 | $1.345 | 0/1 | 61.5s |