Ranking de Resolución de acertijos
Mira qué modelos de IA rinden mejor en Resolución de acertijos, cuáles se mantienen fiables y dónde aparecen las mayores diferencias. Ordenar por: Tiempo de respuesta (promedio) ↓.
Modelos mostrados
15
Promedio de Puntuación de Resolución de acertijos
6.7
Mejor modelo
Muse Spark 1.1 7.8
210/210
Filtrar modelos
Ningún modelo coincide con la búsqueda y los filtros actuales.
| Rango | Modelo | Empresa | Puntuación de Resolución de acertijos | Puntuación | Costo total | Pruebas correctas | Tiempo de respuesta (promedio) |
|---|---|---|---|---|---|---|---|
| #27 | Muse Spark 1.1 high | Meta | 7.8 | 8.1 | $1.694 | 2/3 | 70.0s |
| #99 | Qwen3.6 27B medium | Qwen | 7.7 | 6.5 | $0.779 | 2/3 | 61.1s |
| #58 | Qwen3.5-27B medium | Qwen | 8.2 | 7.4 | $1.627 | 2/3 | 59.6s |
| #46 | DeepSeek V4 Pro high | DeepSeek | 6.9 | 7.7 | $0.200 | 1/3 | 56.8s |
| #143 | Gemini 3.1 Flash Lite high | 5.7 | 5.6 | $2.044 | 1/3 | 50.8s | |
| #47 | MiniMax M3 medium | Minimax | 7.9 | 7.6 | $0.286 | 2/3 | 49.9s |
| #163 | Gemini 3.1 Flash Lite Preview high | 7.7 | 5.3 | $2.310 | 2/3 | 46.7s | |
| #77 | Kimi K2.5 medium | Moonshot AI | 5.3 | 7.0 | $0.600 | 1/3 | 43.2s |
| #16 | Muse Spark 1.1 medium | Meta | 7.9 | 8.6 | $1.357 | 2/3 | 42.5s |
| #52 | Kimi K2.7 Code medium | Moonshot AI | 5.9 | 7.5 | $0.751 | 1/3 | 41.0s |
| #76 | DeepSeek V3.2 medium | DeepSeek | 7.0 | 7.0 | $0.078 | 1/3 | 37.7s |
| #31 | GLM 5.2 high | Z.ai | 6.0 | 8.0 | $0.970 | 1/3 | 33.7s |
| #119 | Qwen3.5-35B-A3B medium | Qwen | 8.2 | 6.2 | $0.837 | 2/3 | 33.1s |
| #57 | Qwen3.5 Plus 2026-02-15 medium | Qwen | 10.0 | 7.5 | $0.437 | 3/3 | 32.5s |
| #204 | Qwen3.5-9B medium | Qwen | 3.0 | 3.8 | $0.036 | 0/3 | 32.3s |