Trivia: Wrong answer
Trivia
Wrong answer
See which AI models are most likely to hit Wrong answer on Trivia, so you can spot weak points faster. Sort by: Response Time (avg) ↓.
Failure Reasons
259/259
Filter models
No models match the current search and filters.
| Rank | Model | Company | Wrong answer Count | Category Score | Total Cost | Tests Correct | Response Time (avg) |
|---|---|---|---|---|---|---|---|
| #94 | Seed-2.0-Code low | Bytedance Seed | 1 | 3.0 | $0.767 | 0/1 | 10.0s |
| #56 | Muse Spark 1.2 low | Meta | 1 | 3.0 | $0.655 | 0/1 | 10.00s |
| #70 | GPT-5 Mini medium | OpenAI | 1 | 3.0 | $0.241 | 0/1 | 9.99s |
| #166 | KAT-Coder-Pro V2.5 none | Kwaipilot | 1 | 3.0 | $0.487 | 0/1 | 9.91s |
| #149 | KAT-Coder-Pro V2.5 medium | Kwaipilot | 1 | 3.0 | $0.478 | 0/1 | 9.87s |
| #136 | Muse Glimmer 30B low | Meta | 1 | 3.0 | $0.143 | 0/1 | 9.71s |
| #39 | Gemini 3.5 Flash Lite high | 1 | 3.0 | $0.540 | 0/1 | 9.68s | |
| #284 | Nemotron 3 Super none | NVIDIA | 1 | 3.0 | $0.008 | 0/1 | 8.94s |
| #185 | Dots 3 Note Preview low | Dots Studio | 1 | 3.0 | $0.000 | 0/1 | 8.80s |
| #64 | Muse Spark 1.1 low | Meta | 1 | 3.0 | $0.673 | 0/1 | 8.17s |
| #160 | GLM 5.3 low | Z.ai | 1 | 3.0 | $0.257 | 0/1 | 7.42s |
| #250 | Laguna S 2.1 medium | Poolside | 1 | 3.0 | $0.053 | 0/1 | 7.11s |
| #68 | Claude Sonnet 5 medium | Anthropic | 1 | 3.0 | $0.922 | 0/1 | 7.06s |
| #15 | GPT-5.6 Sol high | OpenAI | 1 | 4.7 | $0.446 | 0/1 | 6.97s |
| #256 | Laguna S 2.1 high | Poolside | 1 | 3.0 | $0.114 | 0/1 | 6.94s |