Trivia: Wrong answer
Trivia
Wrong answer
See which AI models are most likely to hit Wrong answer on Trivia, so you can spot weak points faster. Sort by: Total Cost ↑.
Failure Reasons
259/259
Filter models
No models match the current search and filters.
| Rank | Model | Company | Wrong answer Count | Category Score | Total Cost | Tests Correct | Response Time (avg) |
|---|---|---|---|---|---|---|---|
| #174 | Gemini 3.1 Flash Lite Preview low | 1 | 3.0 | $0.646 | 0/1 | 1.35s | |
| #115 | Kimi K2.7 Code medium | Moonshot AI | 1 | 3.0 | $0.655 | 0/1 | 341.8s |
| #56 | Muse Spark 1.2 low | Meta | 1 | 3.0 | $0.655 | 0/1 | 10.00s |
| #121 | Claude Sonnet 4.6 none | Anthropic | 1 | 3.0 | $0.661 | 0/1 | 4.67s |
| #23 | Qwen3.8 Max (0902) low | Qwen | 1 | 3.0 | $0.664 | 0/1 | 13.3s |
| #177 | Qwen3.6 35B A3B medium | Qwen | 1 | 3.0 | $0.672 | 0/1 | 32.9s |
| #64 | Muse Spark 1.1 low | Meta | 1 | 3.0 | $0.673 | 0/1 | 8.17s |
| #37 | Qwen3.8 Max (0902) medium | Qwen | 1 | 3.0 | $0.677 | 0/1 | 17.0s |
| #219 | Mimo V2 Omni medium | Xiaomi | 1 | 3.0 | $0.683 | 0/1 | 234.2s |
| #67 | Muse Spark 1.3 low | Meta | 1 | 3.0 | $0.689 | 0/1 | 23.4s |
| #101 | Nemotron 3 Ultra medium | NVIDIA | 1 | 3.0 | $0.701 | 0/1 | 38.5s |
| #50 | Qwen3.8 Max low | Qwen | 1 | 3.0 | $0.702 | 0/1 | 12.4s |
| #143 | GLM 5.1 medium | Z.ai | 1 | 3.0 | $0.727 | 0/1 | 29.4s |
| #140 | Grok 4.3 medium | X AI | 1 | 3.0 | $0.741 | 0/1 | 44.5s |
| #154 | Qwen3.6 Flash medium | Qwen | 1 | 3.0 | $0.741 | 0/1 | 122.9s |