Anti-AI Tricks: Wrong answer
Anti-AI Tricks
Wrong answer
See which AI models are most likely to hit Wrong answer on Anti-AI Tricks, so you can spot weak points faster.
Failure Reasons
188/188
Filter models
No models match the current search and filters.
| Rank | Model | Company | Wrong answer Count | Category Score | Total Cost | Tests Correct | Response Time (avg) |
|---|---|---|---|---|---|---|---|
| #154 | GLM 5V Turbo medium | Z.ai | 1 | 7.2 | $0.457 | 2/4 | 10.8s |
| #156 | Claude Opus 4.7 none | Anthropic | 1 | 8.3 | $0.505 | 3/4 | 2.12s |
| #159 | Gemini 3.1 Flash Lite Preview low | 1 | 8.3 | $0.646 | 3/4 | 2.12s | |
| #165 | Qwen3.6 27B medium | Qwen | 1 | 8.3 | $1.045 | 3/4 | 12.6s |
| #168 | Gemini 3.1 Flash Lite Preview none | 1 | 7.5 | $0.052 | 2/4 | 1.04s | |
| #171 | Dots 3 Note Preview high | Dots Studio | 1 | 8.7 | $0.000 | 3/4 | 6.97s |
| #180 | GPT-5.6 Luna low | OpenAI | 1 | 8.3 | $0.051 | 3/4 | 2.21s |
| #181 | Claude Sonnet 5 none | Anthropic | 1 | 5.3 | $0.548 | 1/4 | 3.60s |
| #182 | Gemini 3.1 Flash Lite minimal | 1 | 8.3 | $0.047 | 3/4 | 1.10s | |
| #184 | gpt-oss-120b medium | OpenAI | 1 | 6.7 | $0.020 | 2/4 | 10.2s |
| #188 | Inkling low | Thinkingmachines | 1 | 8.3 | $0.187 | 3/4 | 2.51s |
| #194 | Trinity Large Thinking low | Arcee AI | 1 | 8.3 | $0.625 | 3/4 | 5.70s |
| #196 | Grok 4.20 Beta medium | X AI | 1 | 8.7 | $0.750 | 3/4 | 3.16s |
| #203 | Dots 3 Note Preview medium | Dots Studio | 1 | 8.7 | $0.000 | 3/4 | 7.76s |
| #206 | GLM 5.3 Flash low | Z.ai | 1 | 8.7 | $0.015 | 3/4 | 2.14s |