Ranking de Resolución de acertijos
Mira qué modelos de IA rinden mejor en Resolución de acertijos, cuáles se mantienen fiables y dónde aparecen las mayores diferencias. Ordenar por: Métrica ↑.
Modelos mostrados
15
Promedio de Puntuación de Resolución de acertijos
6.7
Mejor modelo
Step 3.5 Flash 0.0
220/220
Filtrar modelos
Ningún modelo coincide con la búsqueda y los filtros actuales.
| Rango | Modelo | Empresa | Puntuación de Resolución de acertijos | Puntuación | Costo total | Pruebas correctas | Tiempo de respuesta (promedio) |
|---|---|---|---|---|---|---|---|
| #84 | Seed-2.0-Mini medium | Bytedance Seed | 8.2 | 7.0 | $0.101 | 2/3 | 31.8s |
| #89 | Qwen3.6 Flash medium | Qwen | 8.2 | 6.9 | $0.738 | 2/3 | 6.29s |
| #97 | KAT-Coder-Pro V2.5 none | Kwaipilot | 8.2 | 6.7 | $0.476 | 2/3 | 3.03s |
| #107 | MiMo-V2.5 medium | Xiaomi | 8.2 | 6.5 | $0.082 | 2/3 | 20.3s |
| #120 | Qwen3.5-Flash medium | Qwen | 8.2 | 6.2 | $0.139 | 2/3 | 27.6s |
| #125 | Qwen3.5-35B-A3B medium | Qwen | 8.2 | 6.2 | $0.837 | 2/3 | 33.1s |
| #27 | Muse Spark 1.1 low | Meta | 8.3 | 8.3 | $0.647 | 2/3 | 6.60s |
| #43 | GPT-5.6 Terra medium | OpenAI | 8.4 | 7.8 | $0.676 | 2/3 | 3.78s |
| #104 | Gemini 3.5 Flash-Lite medium | 8.4 | 6.5 | $0.369 | 2/3 | 1.70s | |
| #53 | GLM 5 Turbo medium | Z.ai | 8.7 | 7.6 | $0.323 | 2/3 | 5.23s |
| #16 | GPT-5.3-Codex medium | OpenAI | 9.0 | 8.9 | $0.920 | 2/3 | 5.05s |
| #39 | Seed-2.0-Lite medium | Bytedance Seed | 9.0 | 7.9 | $0.234 | 2/3 | 10.2s |
| #116 | Gemma 4 31B medium | 9.9 | 6.3 | $0.107 | 3/3 | 26.9s | |
| #1 | Gemini 3.6 Flash medium | 10.0 | 9.9 | $0.831 | 3/3 | 2.53s | |
| #2 | Gemini 3.6 Flash high | 10.0 | 9.7 | $1.785 | 3/3 | 3.04s |