View a markdown version of this page

Abilita il lignaggio Snowflake per AWS Glue Offerte di lavoro Spark - Amazon DataZone

Le traduzioni sono generate tramite traduzione automatica. In caso di conflitto tra il contenuto di una traduzione e la versione originale in Inglese, quest'ultima prevarrà.

Abilita il lignaggio Snowflake per AWS Glue Offerte di lavoro Spark

Amazon DataZone può acquisire la derivazione a livello di colonna dai job AWS Glue Spark che leggono o scrivono su un'origine dati Snowflake. Quando abiliti il lineage sul AWS Glue job, il runtime AWS Glue Spark emette eventi di lineage durante l'esecuzione del job e Amazon SageMaker Unified Studio li rende nella vista lineage.

AWS Glue Il runtime Spark include già le DataZone integrazioni OpenLineage Spark e Amazon che utilizza per inviare eventi. L'unico passaggio aggiuntivo consiste nell'aggiornare il client OpenLineage principale (openlineage-java) sul job alla versione. 1.49.0

Prerequisiti

Prima di abilitare il lineage su un job AWS Glue Spark, conferma quanto segue:

  • Un DataZone dominio e un progetto Amazon con una connessione Snowflake già configurati. Per informazioni, consulta Connect Snowflake come fonte di dati in Amazon DataZone.

  • Un job AWS Glue Spark che legge o scrive sulla sorgente Snowflake connessa.

  • Autorizzazione a modificare la configurazione del lavoro. AWS Glue

  • Un bucket Amazon S3 leggibile dal AWS Glue job.

I passaggi seguenti descrivono come aggiornare il client OpenLineage principale sul AWS Glue job e abilitare la generazione di eventi di lineage.

Fase 1: Aggiornare il client OpenLineage principale su AWS Glue job

Il runtime AWS Glue Spark include l'integrazione OpenLineage Spark e l'integrazione Amazon. DataZone Per renderlo compatibile con Amazon DataZone, aggiorna il openlineage-java client sul posto di lavoro alla versione1.49.0.

  1. Scarica openlineage-java-1.49.0.jar da Maven Central. Usa:

  2. Carica il file JAR in un bucket Amazon S3 leggibile dal tuo AWS Glue job.

  3. Nella AWS Glue console, apri il lavoro e scegli Dettagli del lavoro. In Proprietà avanzate, trova il percorso Dependent JARs e aggiungi l'URI S3 del JAR caricato.

  4. Sempre nei dettagli del lavoro, aggiungi il seguente parametro del lavoro:

    Chiave Valore
    --user-jars-first true

    In questo modo il runtime di AWS Glue Spark carica il openlineage-java client caricato anziché la versione fornita in bundle. AWS Glue

Fase 2: Abilita la generazione di eventi di lignaggio su AWS Glue job

  1. Nella AWS Glue console, apri il lavoro e scegli Dettagli del lavoroProprietà di base.

  2. Seleziona Genera eventi di derivazione.

  3. Inserisci il tuo ID di DataZone dominio Amazon nel campo visualizzato. Usa lo stesso ID di dominio che hai usato per creare la connessione Snowflake.

  4. Salva il lavoro.

Verifica che la discendenza sia stata acquisita

Esegui il AWS Glue lavoro. Una volta completato il lavoro, apri la visualizzazione della derivazione in Amazon SageMaker Unified Studio per la tabella di destinazione del tuo progetto. I record di derivazione per le sorgenti Snowflake letti dal job vengono visualizzati come nodi a monte nel grafico.