View a markdown version of this page

Snowflake-Herkunft aktivieren für AWS Glue Spark-Jobs - Amazon DataZone

Die vorliegende Übersetzung wurde maschinell erstellt. Im Falle eines Konflikts oder eines Widerspruchs zwischen dieser übersetzten Fassung und der englischen Fassung (einschließlich infolge von Verzögerungen bei der Übersetzung) ist die englische Fassung maßgeblich.

Snowflake-Herkunft aktivieren für AWS Glue Spark-Jobs

Amazon DataZone kann die Herkunft von AWS Glue Spark-Jobs, die aus einer Snowflake-Datenquelle lesen oder in eine Snowflake-Datenquelle schreiben, auf Spaltenebene erfassen. Wenn Sie Lineage für den AWS Glue Job aktivieren, gibt die AWS Glue Spark-Laufzeit bei der Ausführung des Jobs Lineage-Ereignisse aus, und Amazon SageMaker Unified Studio rendert sie in der Lineage-Ansicht.

AWS Glue Die Spark-Laufzeit enthält bereits die OpenLineage Spark- und DataZone Amazon-Integrationen, die sie zum Senden von Ereignissen verwendet. Der einzige zusätzliche Schritt besteht darin, den OpenLineage Core-Client (openlineage-java) im Job auf Version 1.49.0 zu aktualisieren.

Voraussetzungen

Bevor Sie Lineage für einen AWS Glue Spark-Job aktivieren, müssen Sie Folgendes überprüfen:

  • Eine DataZone Amazon-Domain und ein Projekt mit einer Snowflake-Verbindung sind bereits konfiguriert. Siehe Connect Snowflake als Datenquelle in Amazon DataZone.

  • Ein AWS Glue Spark-Job, der von der verbundenen Snowflake-Quelle liest oder in sie schreibt.

  • Erlaubnis, die Konfiguration des AWS Glue Jobs zu ändern.

  • Ein Amazon S3 S3-Bucket, den der AWS Glue Job lesen kann.

In den folgenden Schritten wird beschrieben, wie Sie den OpenLineage Core-Client für den AWS Glue Job aktualisieren und die Generierung von Lineage-Ereignissen aktivieren.

Schritt 1: Aktualisieren Sie den OpenLineage Core-Client auf dem AWS Glue Auftrag

Die AWS Glue Spark-Laufzeit bündelt die OpenLineage Spark-Integration und die DataZone Amazon-Integration. Um es mit Amazon kompatibel zu machen DataZone, aktualisieren Sie den openlineage-java Client on the Job auf Version1.49.0.

  1. openlineage-java-1.49.0.jarVon Maven Central herunterladen. Verwenden Sie entweder:

  2. Laden Sie das JAR in einen Amazon S3 S3-Bucket hoch, den Ihr AWS Glue Job lesen kann.

  3. Öffnen Sie in der AWS Glue Konsole den Job und wählen Sie Jobdetails aus. Suchen Sie unter Erweiterte Eigenschaften nach dem Pfad für abhängige JARs und fügen Sie die S3-URI der hochgeladenen JAR-Datei hinzu.

  4. Fügen Sie immer noch unter Jobdetails den folgenden Jobparameter hinzu:

    Key (Schlüssel) Value (Wert)
    --user-jars-first true

    Dadurch lädt die AWS Glue Spark-Runtime Ihren hochgeladenen openlineage-java Client und nicht die Version, mit AWS Glue der Sie gebündelt sind.

Schritt 2: Aktivieren Sie die Generierung von Lineage-Ereignissen auf dem AWS Glue Auftrag

  1. Öffnen Sie in der AWS Glue Konsole den Job und wählen Sie JobdetailsBasic properties.

  2. Wählen Sie Herkunftsereignisse generieren aus.

  3. Geben Sie Ihre DataZone Amazon-Domain-ID in das angezeigte Feld ein. Verwenden Sie dieselbe Domain-ID, die Sie beim Erstellen der Snowflake-Verbindung verwendet haben.

  4. Speichern Sie den Job.

Stellen Sie sicher, dass die Abstammung erfasst wurde

Führen Sie den AWS Glue Job aus. Öffnen Sie nach Abschluss des Jobs die Lineage-Ansicht in Amazon SageMaker Unified Studio für die Zieltabelle in Ihrem Projekt. Die Lineage-Datensätze für die Snowflake-Quellen, die vom Job gelesen wurden, werden im Diagramm als Upstream-Knoten angezeigt.