Puzzle Solving Ranking
See which AI models perform best on Puzzle Solving, which ones stay reliable, and where the biggest gaps appear. Sort by: Response Time (avg) ↓.
311/311
Filter models
No models match the current search and filters.
| Rank | Model | Company | Puzzle Solving Score | Score | Total Cost | Tests Correct | Response Time (avg) |
|---|---|---|---|---|---|---|---|
| #270 | Nemotron 3.5 Lightning low | NVIDIA | 3.6 | 4.8 | $0.140 | 0/3 | 6.21s |
| #68 | Step 3.7 Flash medium | Stepfun | 5.7 | 7.9 | $0.495 | 1/3 | 6.19s |
| #20 | Claude Fable 5.1 high | Anthropic | 10.0 | 9.0 | $3.364 | 3/3 | 6.11s |
| #227 | Nemotron 3.5 Lightning high | NVIDIA | 3.6 | 5.6 | $0.134 | 0/3 | 6.09s |
| #162 | Qwen3.6 35B A3B medium | Qwen | 8.0 | 6.6 | $0.672 | 2/3 | 5.95s |
| #47 | GPT-5.2 medium | OpenAI | 7.5 | 8.4 | $1.182 | 2/3 | 5.80s |
| #149 | Gemma 4 26B A4B medium | 10.0 | 6.8 | $0.092 | 3/3 | 5.79s | |
| #107 | Gemini 3 Flash Preview low | 10.0 | 7.4 | $0.185 | 3/3 | 5.77s | |
| #52 | Claude Fable 5.1 medium | Anthropic | 7.6 | 8.3 | $2.909 | 2/3 | 5.70s |
| #34 | GLM 5.3 Flash max | Z.ai | 8.7 | 8.7 | $0.059 | 2/3 | 5.61s |
| #65 | GPT-5.6 Terra high | OpenAI | 7.7 | 8.0 | $0.836 | 2/3 | 5.45s |
| #244 | Ling-2.6-1T none | Inclusionai | 3.1 | 5.3 | $0.016 | 0/3 | 5.36s |
| #277 | Hunter Alpha medium | OpenRouter | 6.1 | 4.7 | $0.000 | 1/3 | 5.35s |
| #147 | MiMo-V2.5-Pro medium | Xiaomi | 6.7 | 6.8 | $0.221 | 1/3 | 5.31s |
| #75 | Claude Sonnet 4.6 medium | Anthropic | 10.0 | 7.8 | $2.126 | 3/3 | 5.31s |