View a markdown version of this page

Activer la lignée Snowflake pour AWS Glue Offres d'emploi Spark - Amazon DataZone

Les traductions sont fournies par des outils de traduction automatique. En cas de conflit entre le contenu d'une traduction et celui de la version originale en anglais, la version anglaise prévaudra.

Activer la lignée Snowflake pour AWS Glue Offres d'emploi Spark

Amazon DataZone peut capturer le lignage au niveau des colonnes à partir de tâches AWS Glue Spark qui lisent ou écrivent dans une source de données Snowflake. Lorsque vous activez le lignage sur la AWS Glue tâche, le moteur d'exécution AWS Glue Spark émet des événements de lignage au fur et à mesure que la tâche s'exécute et Amazon SageMaker Unified Studio les affiche dans la vue de lignée.

AWS Glue Le runtime Spark inclut déjà les DataZone intégrations OpenLineage Spark et Amazon qu'il utilise pour envoyer des événements. La seule étape supplémentaire consiste à mettre à niveau le client OpenLineage principal (openlineage-java) sur le projet vers la version1.49.0.

Conditions préalables

Avant d'activer le lignage sur une tâche AWS Glue Spark, vérifiez les points suivants :

  • Un DataZone domaine Amazon et un projet avec une connexion Snowflake sont déjà configurés. Consultez Connect Snowflake en tant que source de données sur Amazon DataZone.

  • Une tâche AWS Glue Spark qui lit ou écrit dans la source Snowflake connectée.

  • Autorisation de modifier la configuration de la AWS Glue tâche.

  • Un compartiment Amazon S3 que la AWS Glue tâche peut lire.

Les étapes suivantes décrivent comment mettre à niveau le client OpenLineage principal sur place et activer AWS Glue la génération d'événements de lignage.

Étape 1 : mise à niveau du client OpenLineage principal sur le AWS Glue tâche

Le runtime AWS Glue Spark regroupe l'intégration OpenLineage Spark et l' DataZoneintégration Amazon. Pour le rendre compatible avec Amazon DataZone, mettez à niveau le openlineage-java client sur place vers la version1.49.0.

  1. Téléchargez openlineage-java-1.49.0.jar depuis Maven Central. Utilisez soit :

  2. Téléchargez le fichier JAR dans un compartiment Amazon S3 que votre AWS Glue tâche peut lire.

  3. Dans la AWS Glue console, ouvrez le job et choisissez Job details. Sous Propriétés avancées, recherchez le chemin des fichiers JAR dépendants et ajoutez l'URI S3 du fichier JAR téléchargé.

  4. Toujours dans Détails du job, ajoutez le paramètre de job suivant :

    Clé Valeur
    --user-jars-first true

    Cela permet à l'environnement d'exécution de AWS Glue Spark de charger votre openlineage-java client téléchargé au lieu de charger la version fournie avec AWS Glue.

Étape 2 : activer la génération d'événements de lignage sur le AWS Glue tâche

  1. Dans la AWS Glue console, ouvrez le job et choisissez Détails du jobPropriétés de base.

  2. Sélectionnez Générer des événements de lignage.

  3. Entrez votre identifiant DataZone de domaine Amazon dans le champ qui apparaît. Utilisez le même ID de domaine que celui que vous avez utilisé lors de la création de la connexion Snowflake.

  4. Sauvegardez le travail.

Vérifiez que la lignée est capturée

Exécutez le AWS Glue job. Une fois le travail terminé, ouvrez la vue du lignage dans Amazon SageMaker Unified Studio pour la table cible de votre projet. Les enregistrements de lignage des sources Snowflake lues par la tâche apparaissent sous forme de nœuds en amont dans le graphique.