Puzzle Solving Ranking
See which AI models perform best on Puzzle Solving, which ones stay reliable, and where the biggest gaps appear.
311/311
Filter models
No models match the current search and filters.
| Rank | Model | Company | Puzzle Solving Score | Score | Total Cost | Tests Correct | Response Time (avg) |
|---|---|---|---|---|---|---|---|
| #230 | Hy3 preview low | Tencent | 5.3 | 5.5 | $0.042 | 1/3 | 7.51s |
| #236 | GPT-5.6 Luna none | OpenAI | 5.3 | 5.4 | $0.029 | 1/3 | 790ms |
| #264 | Qwen3.6 Plus Preview medium | Qwen | 5.3 | 4.9 | $0.000 | 1/3 | 7.52s |
| #279 | Laguna M.1 medium | Poolside | 5.3 | 4.7 | $0.033 | 1/3 | 10.2s |
| #290 | Elephant Alpha medium | Openrouter | 5.3 | 4.3 | $0.000 | 1/3 | 868ms |
| #293 | Grok 4.20 none | X AI | 5.3 | 4.1 | $0.057 | 1/3 | 473ms |
| #294 | Laguna Xs.2 medium | Poolside | 5.3 | 4.1 | $0.015 | 1/3 | 1.93s |
| #296 | MiMo-V2-Flash none | Xiaomi | 5.3 | 4.0 | $0.025 | 1/3 | 1.86s |
| #306 | Laguna Xs.2 none | Poolside | 5.3 | 3.8 | $0.004 | 1/3 | 650ms |
| #141 | Step 3.7 Flash high | Stepfun | 5.3 | 6.8 | $1.229 | 1/3 | 10.2s |
| #199 | GPT-5 Nano medium | OpenAI | 5.3 | 6.0 | $0.118 | 1/3 | 20.6s |
| #278 | Grok 4.1 Fast medium | X AI | 5.3 | 4.7 | $0.069 | 1/3 | 7.40s |
| #228 | Hy4 preview low | Tencent | 5.3 | 5.6 | $1.745 | 0/3 | 238.0s |
| #178 | Seed-2.0-Lite none | Bytedance Seed | 5.3 | 6.2 | $0.066 | 1/3 | 2.78s |
| #184 | gpt-oss-120b medium | OpenAI | 5.3 | 6.1 | $0.020 | 1/3 | 21.7s |