La puntuación media está prácticamente empatada en 7.9 vs 7.9. No se midió el coste del hardware local, por lo que no hay comparaciones de coste disponibles. Qwen3.8 27B (low) es más rápido con 39.11s vs 142.84s, con tasas de acierto de 77.3% vs 68.2%.
Benchmarks generados a partir de los suites de prueba de AI BENCHY en:
2026-08-15
Rango
#58
Total de tokens de salida
224,128
Tiempo de respuesta (promedio)
142.84s
Costo total
$3.467
Rango
#61
Total de tokens de salida
169,329
Tiempo de respuesta (promedio)
39.11s
Costo total
N/D
Modelo recomendadoQwen3.8 27B (low)
Tiene la mejor puntuación aquí (7.9) y responde aproximadamente 3.7x más rápido que Kimi K3 (max).
Qwen3.8 27BQwen3.8 27BlowLas respuestas del modelo candidato se generaron en hardware local. OpenRouter se usó solo para evaluar.Lanzamiento: 2026-08-14
Qwen3.8 27BQwen3.8 27BlowLas respuestas del modelo candidato se generaron en hardware local. OpenRouter se usó solo para evaluar.Lanzamiento: 2026-08-14
Puntuación
7.9Puntaje promedio en todas las pruebas de benchmark.…
7.9Puntaje promedio en todas las pruebas de benchmark.…
Rango
#58
#61
Fiabilidad
9.0Puntuación de éxito en el primer intento: 10.0 significa que no hubo fallos reintentables de la API objetivo ni de límite de tasa antes de llamadas exitosas; los fallos registrados bajan la puntuación.…
10.0Puntuación de éxito en el primer intento: 10.0 significa que no hubo fallos reintentables de la API objetivo ni de límite de tasa antes de llamadas exitosas; los fallos registrados bajan la puntuación.…
Consistencia
9.2La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
10.0La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
Intentos
66/66
66/66
Pruebas correctas
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Error de API: 2Sin respuesta: 2Formato extra: 1Tiempo agotado: 1Tiempo de respuesta (promedio)142.84sTiempo de respuesta (máximo)766.58sTiempo de respuesta (total)2714.02sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 4Sin respuesta: 2No siguió las instrucciones: 1Tiempo de respuesta (promedio)39.11sTiempo de respuesta (máximo)376.04sTiempo de respuesta (total)860.51sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
Tasa de aciertos por intento
77.3%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
68.2%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
Pruebas inestables
2Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
0Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Ejecuciones totales
66Ejecuciones totales…
66Ejecuciones totales…
Costo por resultado
21.668Muestra el costo promedio por respuesta correcta del benchmark en centavos (menor es mejor).…
N/DMuestra el costo promedio por respuesta correcta del benchmark en centavos (menor es mejor).…
Costo total
$3.467Costo total (precio actual)…
N/DCosto total (precio actual)…
Precio de entrada
$3.000 / 1MPrecio de entrada…
N/DPrecio de entrada…
Precio de salida
$15.000 / 1MPrecio de salida…
N/DPrecio de salida…
Total de tokens de entrada
34,960Total de tokens de entrada…
99,705Total de tokens de entrada…
Tokens de salida
2,887Tokens de salida…
1,545Tokens de salida…
Tokens de razonamiento
221,241Tokens de razonamiento…
167,784Tokens de razonamiento…
Tiempo de respuesta (promedio)
142.84sTiempo de respuesta (promedio)…
39.11sTiempo de respuesta (promedio)…
Tiempo de respuesta (máximo)
766.58sTiempo de respuesta (máximo)…
376.04sTiempo de respuesta (máximo)…
Tiempo de respuesta (total)
2714.02sTiempo de respuesta (total)…
860.51sTiempo de respuesta (total)…
Parámetros
2.8T en total (104B activos)
27.3B
Disponibilidad
Pesos disponibles
Pesos disponibles
Generación showcase de modelos
Hamster playing table tennis
Prompt: Create a detailed SVG illustration of a hamster playing table tennis.
#58 MoonshotAI: Kimi K3
max
Coste
$0.281
Tiempo
506.9s
Tokens
18,863 tok
#61 Qwen3.8 27B
lowLas respuestas del modelo candidato se generaron en hardware local. OpenRouter se usó solo para evaluar.
10.0Puntaje promedio en todas las pruebas de benchmark.…
10.0La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
100.0%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
0Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No hay respuestas fallidas.Tiempo de respuesta (promedio)10.24sTiempo de respuesta (máximo)15.21sTiempo de respuesta (total)40.97sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
10.24sTiempo de respuesta (promedio)…
1,638Total de tokens de entrada…
496Tokens de salida…
2,629Tokens de razonamiento…
Qwen3.8 27BLas respuestas del modelo candidato se generaron en hardware local. OpenRouter se usó solo para evaluar.
10.0Puntaje promedio en todas las pruebas de benchmark.…
10.0La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
100.0%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
0Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No hay respuestas fallidas.Tiempo de respuesta (promedio)3.02sTiempo de respuesta (máximo)5.68sTiempo de respuesta (total)12.07sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
10.0Puntaje promedio en todas las pruebas de benchmark.…
10.0La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
100.0%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
0Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No hay respuestas fallidas.Tiempo de respuesta (promedio)325.79sTiempo de respuesta (máximo)589.43sTiempo de respuesta (total)977.36sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
325.79sTiempo de respuesta (promedio)…
8,061Total de tokens de entrada…
460Tokens de salida…
84,012Tokens de razonamiento…
Qwen3.8 27BLas respuestas del modelo candidato se generaron en hardware local. OpenRouter se usó solo para evaluar.
7.7Puntaje promedio en todas las pruebas de benchmark.…
10.0La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
66.7%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
0Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Sin respuesta: 1Tiempo de respuesta (promedio)140.92sTiempo de respuesta (máximo)376.04sTiempo de respuesta (total)422.75sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
6.5Puntaje promedio en todas las pruebas de benchmark.…
10.0La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
50.0%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
0Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Error de API: 1Tiempo de respuesta (promedio)223.03sTiempo de respuesta (máximo)223.03sTiempo de respuesta (total)223.03sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
223.03sTiempo de respuesta (promedio)…
12,792Total de tokens de entrada…
399Tokens de salida…
20,460Tokens de razonamiento…
Qwen3.8 27BLas respuestas del modelo candidato se generaron en hardware local. OpenRouter se usó solo para evaluar.
10.0Puntaje promedio en todas las pruebas de benchmark.…
10.0La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
100.0%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
0Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No hay respuestas fallidas.Tiempo de respuesta (promedio)90.63sTiempo de respuesta (máximo)143.71sTiempo de respuesta (total)181.27sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
7.3Puntaje promedio en todas las pruebas de benchmark.…
5.8La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
83.3%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
1Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Formato extra: 1Tiempo de respuesta (promedio)16.72sTiempo de respuesta (máximo)18.73sTiempo de respuesta (total)33.44sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
16.72sTiempo de respuesta (promedio)…
7,839Total de tokens de entrada…
354Tokens de salida…
2,606Tokens de razonamiento…
Qwen3.8 27BLas respuestas del modelo candidato se generaron en hardware local. OpenRouter se usó solo para evaluar.
10.0Puntaje promedio en todas las pruebas de benchmark.…
10.0La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
100.0%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
0Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No hay respuestas fallidas.Tiempo de respuesta (promedio)8.03sTiempo de respuesta (máximo)9.09sTiempo de respuesta (total)16.06sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
5.3Puntaje promedio en todas las pruebas de benchmark.…
7.2La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
44.4%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
1Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Sin respuesta: 1Tiempo agotado: 1Tiempo de respuesta (promedio)683.62sTiempo de respuesta (máximo)766.58sTiempo de respuesta (total)1367.25sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
683.62sTiempo de respuesta (promedio)…
838Total de tokens de entrada…
57Tokens de salida…
106,892Tokens de razonamiento…
Qwen3.8 27BLas respuestas del modelo candidato se generaron en hardware local. OpenRouter se usó solo para evaluar.
5.3Puntaje promedio en todas las pruebas de benchmark.…
10.0La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
33.3%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
0Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 2Tiempo de respuesta (promedio)60.78sTiempo de respuesta (máximo)120.94sTiempo de respuesta (total)182.34sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
10.0Puntaje promedio en todas las pruebas de benchmark.…
10.0La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
100.0%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
0Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No hay respuestas fallidas.Tiempo de respuesta (promedio)14.91sTiempo de respuesta (máximo)14.91sTiempo de respuesta (total)14.91sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
14.91sTiempo de respuesta (promedio)…
732Total de tokens de entrada…
191Tokens de salida…
871Tokens de razonamiento…
Qwen3.8 27BLas respuestas del modelo candidato se generaron en hardware local. OpenRouter se usó solo para evaluar.
5.0Puntaje promedio en todas las pruebas de benchmark.…
10.0La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
0.0%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
0Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No siguió las instrucciones: 1Tiempo de respuesta (promedio)5.37sTiempo de respuesta (máximo)5.37sTiempo de respuesta (total)5.37sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
10.0Puntaje promedio en todas las pruebas de benchmark.…
10.0La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
100.0%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
0Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No hay respuestas fallidas.Tiempo de respuesta (promedio)7.66sTiempo de respuesta (máximo)7.99sTiempo de respuesta (total)15.33sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
7.66sTiempo de respuesta (promedio)…
1,179Total de tokens de entrada…
147Tokens de salida…
1,119Tokens de razonamiento…
Qwen3.8 27BLas respuestas del modelo candidato se generaron en hardware local. OpenRouter se usó solo para evaluar.
10.0Puntaje promedio en todas las pruebas de benchmark.…
10.0La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
100.0%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
0Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No hay respuestas fallidas.Tiempo de respuesta (promedio)2.43sTiempo de respuesta (máximo)2.87sTiempo de respuesta (total)4.86sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
10.0Puntaje promedio en todas las pruebas de benchmark.…
10.0La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
100.0%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
0Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No hay respuestas fallidas.Tiempo de respuesta (promedio)7.36sTiempo de respuesta (máximo)12.30sTiempo de respuesta (total)22.07sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
7.36sTiempo de respuesta (promedio)…
1,416Total de tokens de entrada…
495Tokens de salida…
1,368Tokens de razonamiento…
Qwen3.8 27BLas respuestas del modelo candidato se generaron en hardware local. OpenRouter se usó solo para evaluar.
7.7Puntaje promedio en todas las pruebas de benchmark.…
10.0La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
66.7%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
0Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 1Tiempo de respuesta (promedio)4.91sTiempo de respuesta (máximo)8.81sTiempo de respuesta (total)14.74sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
3.0Puntaje promedio en todas las pruebas de benchmark.…
10.0La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
0.0%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
0Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Error de API: 1Tiempo de respuesta (promedio)0msTiempo de respuesta (máximo)0msTiempo de respuesta (total)0msUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
0msTiempo de respuesta (promedio)…
0Total de tokens de entrada…
0Tokens de salida…
0Tokens de razonamiento…
Qwen3.8 27BLas respuestas del modelo candidato se generaron en hardware local. OpenRouter se usó solo para evaluar.
3.0Puntaje promedio en todas las pruebas de benchmark.…
10.0La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
0.0%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
0Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 1Tiempo de respuesta (promedio)8.42sTiempo de respuesta (máximo)8.42sTiempo de respuesta (total)8.42sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
3.0Puntaje promedio en todas las pruebas de benchmark.…
10.0La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
0.0%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
0Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Sin respuesta: 1Tiempo de respuesta (promedio)19.67sTiempo de respuesta (máximo)19.67sTiempo de respuesta (total)19.67sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
19.67sTiempo de respuesta (promedio)…
465Total de tokens de entrada…
288Tokens de salida…
1,284Tokens de razonamiento…
Qwen3.8 27BLas respuestas del modelo candidato se generaron en hardware local. OpenRouter se usó solo para evaluar.
3.0Puntaje promedio en todas las pruebas de benchmark.…
10.0La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
0.0%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
0Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Sin respuesta: 1Tiempo de respuesta (promedio)12.64sTiempo de respuesta (máximo)12.64sTiempo de respuesta (total)12.64sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…