Puzzle Solving Ranking
See which AI models perform best on Puzzle Solving, which ones stay reliable, and where the biggest gaps appear. Sort by: Response Time (avg) ↑.
311/311
Filter models
No models match the current search and filters.
| Rank | Model | Company | Puzzle Solving Score | Score | Total Cost | Tests Correct | Response Time (avg) |
|---|---|---|---|---|---|---|---|
| #310 | Step 3.5 Flash none | Stepfun | 0.0 | 2.3 | $0.020 | 0/0 | 0ms |
| #251 | Mistral Small 4 none | Mistral | 3.1 | 5.1 | $0.022 | 0/3 | 399ms |
| #293 | Grok 4.20 none | X AI | 5.3 | 4.1 | $0.057 | 1/3 | 473ms |
| #309 | Nemotron 3 Nano Omni 30b A3b Reasoning none | NVIDIA | 3.0 | 3.2 | $0.000 | 0/3 | 532ms |
| #281 | Mercury 2 none | Inception | 3.1 | 4.7 | $0.030 | 0/3 | 535ms |
| #286 | Grok 4.20 Beta none | X AI | 7.7 | 4.4 | $0.087 | 2/3 | 586ms |
| #195 | Gemini 2.5 Flash none | 7.7 | 6.0 | $0.017 | 2/3 | 604ms | |
| #298 | Granite 4.1 8B none | IBM Granite | 3.2 | 4.0 | $0.007 | 0/3 | 608ms |
| #256 | Qwen3.5-9B none | Qwen | 3.2 | 5.1 | $0.021 | 0/3 | 621ms |
| #306 | Laguna Xs.2 none | Poolside | 5.3 | 3.8 | $0.004 | 1/3 | 650ms |
| #241 | Inkling Small none | Thinkingmachines | 3.2 | 5.3 | $0.054 | 0/3 | 665ms |
| #265 | Mercury 2.5 Preview none | Inception | 5.6 | 4.9 | $0.018 | 1/3 | 684ms |
| #260 | Mercury 2.5 Preview low | Inception | 8.2 | 5.0 | $0.011 | 2/3 | 710ms |
| #186 | Gemini 3.1 Flash Lite none | 6.3 | 6.1 | $0.046 | 1/3 | 720ms | |
| #223 | Gemma 4 26B A4B none | 6.2 | 5.6 | $0.015 | 1/3 | 744ms |