View a markdown version of this page

Habilitar el linaje Snowflake para AWS Glue Trabajos de Spark - Amazon DataZone

Las traducciones son generadas a través de traducción automática. En caso de conflicto entre la traducción y la version original de inglés, prevalecerá la version en inglés.

Habilitar el linaje Snowflake para AWS Glue Trabajos de Spark

Amazon DataZone puede capturar el linaje a nivel de columna de los trabajos de AWS Glue Spark que leen o escriben en una fuente de datos de Snowflake. Al habilitar el linaje en el AWS Glue trabajo, el motor de ejecución de AWS Glue Spark emite eventos de linaje a medida que se ejecuta el trabajo y Amazon SageMaker Unified Studio los renderiza en la vista de linaje.

AWS Glue El tiempo de ejecución de OpenLineage Spark ya incluye las DataZone integraciones de Spark y Amazon que utiliza para enviar eventos. El único paso adicional es actualizar el cliente OpenLineage principal (openlineage-java) que se encuentra en funcionamiento a la versión 1.49.0 original.

Requisitos previos

Antes de activar el linaje en un trabajo de AWS Glue Spark, confirma lo siguiente:

  • Un DataZone dominio y un proyecto de Amazon con una conexión a Snowflake ya configurados. Consulte Connect Snowflake como fuente de datos en Amazon DataZone.

  • Un trabajo de AWS Glue Spark que lee o escribe en la fuente de Snowflake conectada.

  • Permiso para modificar la configuración del AWS Glue trabajo.

  • Un bucket de Amazon S3 que la AWS Glue tarea pueda leer.

Los siguientes pasos describen cómo actualizar el cliente OpenLineage principal del AWS Glue trabajo y habilitar la generación de eventos de linaje.

Paso 1: Actualice el cliente OpenLineage principal en el AWS Glue job

El tiempo de ejecución de AWS Glue Spark incluye la integración de OpenLineage Spark y la DataZone integración de Amazon. Para hacerlo compatible con Amazon DataZone, actualiza el openlineage-java cliente en el trabajo a la versión1.49.0.

  1. openlineage-java-1.49.0.jarDescárguelo desde Maven Central. Utilice:

  2. Suba el JAR a un bucket de Amazon S3 que su AWS Glue trabajo pueda leer.

  3. En la AWS Glue consola, abra el trabajo y seleccione Detalles del trabajo. En Propiedades avanzadas, busque la ruta de los JAR dependientes y añada el URI de S3 del JAR cargado.

  4. Aún en Detalles del trabajo, añada el siguiente parámetro de trabajo:

    Clave Valor
    --user-jars-first true

    Esto hace que el motor de ejecución de AWS Glue Spark cargue el openlineage-java cliente cargado en lugar de cargar la versión que viene AWS Glue incluida.

Paso 2: Habilita la generación de eventos de linaje en AWS Glue job

  1. En la AWS Glue consola, abra el trabajo y elija Detalles del trabajoPropiedades básicas.

  2. Seleccione Generar eventos de linaje.

  3. Introduce tu ID DataZone de dominio de Amazon en el campo que aparece. Usa el mismo ID de dominio que usaste al crear la conexión con Snowflake.

  4. Guarde el trabajo.

Verifica que se capture el linaje

Ejecute el AWS Glue trabajo. Una vez finalizado el trabajo, abra la vista de linaje en Amazon SageMaker Unified Studio para la tabla de destino del proyecto. Los registros de linaje de las fuentes de Snowflake leídas por el trabajo aparecen como nodos ascendentes en el gráfico.