Puzzle Solving Ranking
See which AI models perform best on Puzzle Solving, which ones stay reliable, and where the biggest gaps appear. Sort by: Metric ↑.
311/311
Filter models
No models match the current search and filters.
| Rank | Model | Company | Puzzle Solving Score | Score | Total Cost | Tests Correct | Response Time (avg) |
|---|---|---|---|---|---|---|---|
| #51 | Muse Spark 1.1 low | Meta | 8.3 | 8.3 | $0.673 | 2/3 | 6.60s |
| #76 | Qwen3.8 27B medium | Qwen | 8.3 | 7.8 | ~$0.058 | 2/3 | 12.6s |
| #74 | GPT-5.6 Terra medium | OpenAI | 8.4 | 7.8 | $0.523 | 2/3 | 3.78s |
| #85 | GLM 5 Turbo medium | Z.ai | 8.7 | 7.6 | $0.323 | 2/3 | 5.23s |
| #125 | Solar Pro 4 high | Upstage | 8.7 | 7.1 | $0.046 | 2/3 | 55.2s |
| #26 | Muse Spark 1.3 high | Meta | 8.7 | 8.9 | $1.653 | 2/3 | 38.4s |
| #34 | GLM 5.3 Flash max | Z.ai | 8.7 | 8.7 | $0.059 | 2/3 | 5.61s |
| #37 | Muse Spark 1.2 medium | Meta | 8.7 | 8.6 | $1.339 | 2/3 | 9.45s |
| #44 | Muse Spark 1.2 low | Meta | 8.7 | 8.4 | $0.655 | 2/3 | 5.17s |
| #45 | Grok 4.6 medium | X AI | 8.7 | 8.4 | $1.713 | 2/3 | 16.3s |
| #87 | Solar Pro 4 xhigh | Upstage | 8.9 | 7.6 | $0.050 | 2/3 | 58.0s |
| #25 | GPT-5.3-Codex medium | OpenAI | 9.0 | 8.9 | $0.988 | 2/3 | 5.05s |
| #77 | Seed-2.0-Lite medium | Bytedance Seed | 9.0 | 7.8 | $0.236 | 2/3 | 10.2s |
| #143 | Solar Pro 4 low | Upstage | 9.0 | 6.8 | $0.044 | 2/3 | 42.1s |
| #144 | Solar Pro 4 medium | Upstage | 9.0 | 6.8 | $0.047 | 2/3 | 45.8s |