Trivia: Wrong answer
Trivia
Wrong answer
See which AI models are most likely to hit Wrong answer on Trivia, so you can spot weak points faster. Sort by: Total Cost ↓.
Failure Reasons
259/259
Filter models
No models match the current search and filters.
| Rank | Model | Company | Wrong answer Count | Category Score | Total Cost | Tests Correct | Response Time (avg) |
|---|---|---|---|---|---|---|---|
| #57 | Grok 4.6 medium | X AI | 1 | 3.0 | $1.713 | 0/1 | 46.9s |
| #33 | Muse Spark 1.3 high | Meta | 1 | 3.0 | $1.653 | 0/1 | 140.1s |
| #51 | GPT-5.4 medium | OpenAI | 1 | 3.0 | $1.560 | 0/1 | 14.0s |
| #24 | Seed 2.1 Turbo low | Bytedance Seed | 1 | 3.0 | $1.546 | 0/1 | 171.9s |
| #44 | Claude Opus 4.7 medium | Anthropic | 1 | 3.0 | $1.476 | 0/1 | 2.25s |
| #38 | Muse Spark 1.3 medium | Meta | 1 | 3.0 | $1.469 | 0/1 | 85.6s |
| #47 | Muse Spark 1.1 medium | Meta | 1 | 3.0 | $1.420 | 0/1 | 18.5s |
| #46 | Muse Spark 1.2 medium | Meta | 1 | 3.0 | $1.339 | 0/1 | 12.8s |
| #9 | GPT-6 Astra low | OpenAI | 1 | 3.0 | $1.289 | 0/1 | 4.12s |
| #152 | Seed-2.0-Code high | Bytedance Seed | 1 | 3.0 | $1.273 | 0/1 | 52.2s |
| #16 | GPT-5.5 low | OpenAI | 1 | 3.0 | $1.257 | 0/1 | 10.1s |
| #129 | Kimi K2.6 medium | Moonshot AI | 1 | 3.0 | $1.247 | 0/1 | 130.3s |
| #59 | GPT-5.2 medium | OpenAI | 1 | 3.0 | $1.182 | 0/1 | 28.2s |
| #198 | Qwen3.5-35B-A3B medium | Qwen | 1 | 3.0 | $1.172 | 0/1 | 177.4s |
| #34 | Pareto none | Unbiased | 1 | 2.8 | $1.172 | 0/1 | 32.1s |