View a markdown version of this page

Crear y trabajar con AWS Glue DataBrew trabajos de perfil - AWS Glue DataBrew Guía para desarrolladores

Las traducciones son generadas a través de traducción automática. En caso de conflicto entre la traducción y la version original de inglés, prevalecerá la version en inglés.

Crear y trabajar con AWS Glue DataBrew trabajos de perfil

Los trabajos de perfil ejecutan una serie de evaluaciones en un conjunto de datos y envían los resultados a Amazon S3. La información que recopila la creación de perfiles de datos le ayuda a comprender su conjunto de datos y a decidir qué tipo de pasos de preparación de datos desea seguir en sus trabajos de preparación de datos.

La forma más sencilla de ejecutar un trabajo de perfil es utilizar la configuración predeterminada DataBrew . Puede configurar el trabajo de perfil antes de ejecutarlo para que devuelva solo la información que desee.

Utilice el siguiente procedimiento para crear un trabajo DataBrew de perfil.

Para crear un trabajo de perfil
  1. Inicie sesión en Consola de administración de AWS y abra la DataBrew consola en https://console.aws.amazon.com/databrew/.

  2. Elija TRABAJOS en el panel de navegación, elija la pestaña Perfil de trabajos y, a continuación, elija Crear trabajo.

  3. Introduzca un nombre para su trabajo y, a continuación, seleccione Crear un trabajo de perfil.

  4. Para la entrada de Job, proporcione el nombre del conjunto de datos que se va a perfilar.

  5. (Opcional) Configure lo siguiente en el panel de configuraciones del perfil de datos:

    • Configuraciones a nivel de conjunto de datos: configure los detalles del trabajo de su perfil para todas las columnas de su conjunto de datos.

      Si lo desea, puede activar la capacidad de detectar y contar filas duplicadas en el conjunto de datos. También puedes elegir Activar la matriz de correlaciones y seleccionar columnas para ver qué tan estrechamente están relacionados los valores de varias columnas. Para obtener más información sobre las estadísticas que puede configurar a nivel de conjunto de datos, consulteEstadísticas configurables a nivel de conjunto de datos. Puede configurar las estadísticas en la DataBrew consola o mediante la DataBrew API o AWS los SDK.

    • Configuraciones a nivel de columna: con los ajustes de configuración de perfil predeterminados, puede seleccionar las columnas que desee incluir en el trabajo de su perfil. Utilice Añadir anulación de configuración para seleccionar las columnas cuyas columnas desea limitar el número de estadísticas recopiladas o anular la configuración predeterminada de determinadas estadísticas. Para obtener información detallada sobre las estadísticas que puede configurar a nivel de columna, consulte. Estadísticas configurables a nivel de columna Puede configurar las estadísticas en la DataBrew consola o mediante la DataBrew API o AWS los SDK.

      Asegúrese de que cualquier modificación de configuración que especifique se aplique a las columnas que haya incluido en el trabajo de su perfil. Si hay conflictos entre las distintas anulaciones que haya configurado para una columna, tendrá prioridad la última modificación conflictiva.

  6. (Opcional) Puede crear reglas de calidad de los datos y aplicar conjuntos de reglas adicionales asociados a este conjunto de datos o eliminar los que ya se hayan aplicado. Para obtener más información sobre la validación de la calidad de los datos, consulte. Validación de la calidad de los datos en AWS Glue DataBrew

  7. En el panel de configuración avanzada del trabajo, puede elegir más opciones para ejecutar el trabajo:

    • Número máximo de unidades: DataBrew procesa los trabajos con varios nodos de cómputo y se ejecutan en paralelo. El número predeterminado de nodos es 5. El número máximo de nodos es 149.

    • Tiempo de espera del trabajo: si un trabajo tarda más de los minutos que ha establecido aquí en ejecutarse, se produce un error de tiempo de espera. El valor predeterminado es de 2880 minutos o 48 horas.

    • Número de reintentos: si un trabajo falla mientras se está ejecutando, DataBrew puede intentar volver a ejecutarlo. De forma predeterminada, el trabajo no se vuelve a intentar.

    • Habilitar Amazon CloudWatch Logs para el trabajo: DataBrew permite publicar información de diagnóstico en CloudWatch Logs. Estos registros pueden ser útiles para solucionar problemas o para obtener más detalles sobre cómo se procesa el trabajo.

  8. En el caso de Associated Schedule, puede aplicar un DataBrew cronograma de trabajo para que el trabajo se ejecute en un momento determinado o de forma periódica. Para obtener más información, consulte Automatizar la ejecución de los trabajos con un cronograma.

  9. Cuando los ajustes sean los que desea, elija Crear trabajo. O bien, si desea ejecutar el trabajo inmediatamente, elija Crear y ejecutar trabajo.