Les traductions sont fournies par des outils de traduction automatique. En cas de conflit entre le contenu d'une traduction et celui de la version originale en anglais, la version anglaise prévaudra.
Activer la lignée Snowflake pour AWS Glue Offres d'emploi Spark
Amazon DataZone peut capturer le lignage au niveau des colonnes à partir de tâches AWS Glue Spark qui lisent ou écrivent dans une source de données Snowflake. Lorsque vous activez le lignage sur la AWS Glue tâche, le moteur d'exécution AWS Glue Spark émet des événements de lignage au fur et à mesure que la tâche s'exécute et Amazon SageMaker Unified Studio les affiche dans la vue de lignée.
AWS Glue Le runtime Spark inclut déjà les DataZone intégrations OpenLineage Spark et Amazon qu'il utilise pour envoyer des événements. La seule étape supplémentaire consiste à mettre à niveau le client OpenLineage principal (openlineage-java) sur le projet vers la version1.49.0.
Conditions préalables
Avant d'activer le lignage sur une tâche AWS Glue Spark, vérifiez les points suivants :
-
Un DataZone domaine Amazon et un projet avec une connexion Snowflake sont déjà configurés. Consultez Connect Snowflake en tant que source de données sur Amazon DataZone.
-
Une tâche AWS Glue Spark qui lit ou écrit dans la source Snowflake connectée.
-
Autorisation de modifier la configuration de la AWS Glue tâche.
-
Un compartiment Amazon S3 que la AWS Glue tâche peut lire.
Les étapes suivantes décrivent comment mettre à niveau le client OpenLineage principal sur place et activer AWS Glue la génération d'événements de lignage.
Étape 1 : mise à niveau du client OpenLineage principal sur le AWS Glue tâche
Le runtime AWS Glue Spark regroupe l'intégration OpenLineage Spark et l' DataZoneintégration Amazon. Pour le rendre compatible avec Amazon DataZone, mettez à niveau le openlineage-java client sur place vers la version1.49.0.
-
Téléchargez
openlineage-java-1.49.0.jardepuis Maven Central. Utilisez soit :-
La page du référentiel Maven
. Choisissez JAR à télécharger.
-
-
Téléchargez le fichier JAR dans un compartiment Amazon S3 que votre AWS Glue tâche peut lire.
-
Dans la AWS Glue console, ouvrez le job et choisissez Job details. Sous Propriétés avancées, recherchez le chemin des fichiers JAR dépendants et ajoutez l'URI S3 du fichier JAR téléchargé.
-
Toujours dans Détails du job, ajoutez le paramètre de job suivant :
Clé Valeur --user-jars-firsttrueCela permet à l'environnement d'exécution de AWS Glue Spark de charger votre
openlineage-javaclient téléchargé au lieu de charger la version fournie avec AWS Glue.
Étape 2 : activer la génération d'événements de lignage sur le AWS Glue tâche
-
Dans la AWS Glue console, ouvrez le job et choisissez Détails du job → Propriétés de base.
-
Sélectionnez Générer des événements de lignage.
-
Entrez votre identifiant DataZone de domaine Amazon dans le champ qui apparaît. Utilisez le même ID de domaine que celui que vous avez utilisé lors de la création de la connexion Snowflake.
-
Sauvegardez le travail.
Vérifiez que la lignée est capturée
Exécutez le AWS Glue job. Une fois le travail terminé, ouvrez la vue du lignage dans Amazon SageMaker Unified Studio pour la table cible de votre projet. Les enregistrements de lignage des sources Snowflake lues par la tâche apparaissent sous forme de nœuds en amont dans le graphique.