Puzzle Solving Ranking
See which AI models perform best on Puzzle Solving, which ones stay reliable, and where the biggest gaps appear. Sort by: Metric ↑.
311/311
Filter models
No models match the current search and filters.
| Rank | Model | Company | Puzzle Solving Score | Score | Total Cost | Tests Correct | Response Time (avg) |
|---|---|---|---|---|---|---|---|
| #179 | Gemma 4 31B medium | 9.9 | 6.2 | $0.100 | 3/3 | 26.9s | |
| #41 | Qwen3.8 Max low | Qwen | 9.9 | 8.6 | $0.702 | 3/3 | 4.11s |
| #49 | Seed 2.1 Turbo medium | Bytedance Seed | 9.9 | 8.4 | $1.951 | 3/3 | 21.0s |
| #81 | Seed-2.0-Code low | Bytedance Seed | 9.9 | 7.7 | $0.767 | 3/3 | 12.5s |
| #1 | Gemini 3.6 Flash high | 10.0 | 9.9 | $0.699 | 3/3 | 3.36s | |
| #2 | Gemini 3.8 Flash high | 10.0 | 9.9 | $1.595 | 3/3 | 3.44s | |
| #3 | Gemini 3.7 Flash high | 10.0 | 9.8 | $0.646 | 3/3 | 2.76s | |
| #4 | Gemini 3.6 Flash medium | 10.0 | 9.8 | $0.427 | 3/3 | 3.43s | |
| #6 | Gemini 3 Flash Preview medium | 10.0 | 9.5 | $0.763 | 3/3 | 4.05s | |
| #7 | Gemini 3.5 Flash high | 10.0 | 9.4 | $2.011 | 3/3 | 3.23s | |
| #8 | Gemini 3.7 Flash medium | 10.0 | 9.4 | $0.309 | 3/3 | 2.33s | |
| #10 | GPT-5.6 Sol high | OpenAI | 10.0 | 9.4 | $0.446 | 3/3 | 4.10s |
| #11 | GPT-5.5 low | OpenAI | 10.0 | 9.3 | $1.257 | 3/3 | 4.74s |
| #12 | Grok 4.6 high | X AI | 10.0 | 9.3 | $1.908 | 3/3 | 15.6s |
| #13 | Gemini 3.1 Pro Preview medium | 10.0 | 9.2 | $1.352 | 3/3 | 6.90s |