

翻訳は機械翻訳により提供されています。提供された翻訳内容と英語版の間で齟齬、不一致または矛盾がある場合、英語版が優先します。

# Spark ジョブの Snowflake AWS Glue 系統を有効にする
<a name="snowflake-lineage-glue-spark"></a>

Amazon DataZone は、Snowflake データソースとの間で読み書きする Spark AWS Glue ジョブから列レベルの系統をキャプチャできます。 AWS Glue ジョブで系統を有効にすると、 AWS Glue Spark ランタイムはジョブの実行時に系統イベントを出力し、Amazon SageMaker Unified Studio は系統ビューでレンダリングします。

AWS Glueの Spark ランタイムには、イベントの送信に使用する OpenLineage Spark と Amazon DataZone の統合が既に含まれています。唯一の追加ステップは、ジョブの OpenLineage コアクライアント (`openlineage-java`) をバージョン にアップグレードすることです`1.49.0`。

## 前提条件
<a name="snowflake-lineage-glue-spark-prerequisites"></a>

Spark AWS Glue ジョブで系統を有効にする前に、以下を確認してください。
+ Snowflake 接続が既に設定されている Amazon DataZone ドメインとプロジェクト。「[Amazon DataZone でデータソースとして Snowflake を接続する](snowflake-data-source.md)」を参照してください。
+ 接続された Snowflake AWS Glue ソースとの間で読み取りまたは書き込みを行う Spark ジョブ。
+  AWS Glue ジョブの設定を変更するアクセス許可。
+  AWS Glue ジョブが読み取ることができる Amazon S3 バケット。

次の手順では、 AWS Glue ジョブで OpenLineage コアクライアントをアップグレードし、系統イベント生成を有効にする方法について説明します。

## ステップ 1: AWS Glue ジョブで OpenLineage コアクライアントをアップグレードする
<a name="snowflake-lineage-glue-spark-step1"></a>

 AWS Glue Spark ランタイムは、OpenLineage Spark 統合と Amazon DataZone 統合をバンドルします。Amazon DataZone と互換性を持たせるには、ジョブの `openlineage-java` クライアントをバージョン にアップグレードします`1.49.0`。

1. Maven Central `openlineage-java-1.49.0.jar`からダウンロードします。次のいずれかを使用してください。
   + [Maven リポジトリページ](https://mvnrepository.com/artifact/io.openlineage/openlineage-java/1.49.0)。ダウンロードする **jar** を選択します。
   + [Maven の直接 URL](https://repo1.maven.org/maven2/io/openlineage/openlineage-java/1.49.0/)。

1.  AWS Glue ジョブが読み取れる Amazon S3 バケットに JAR をアップロードします。

1.  AWS Glue コンソールでジョブを開き、**ジョブの詳細**を選択します。**詳細プロパティ**で、**依存 JARsパス**を見つけ、アップロードされた JAR の S3 URI を追加します。

1. ジョブ**の詳細**で、次のジョブパラメータを追加します。    
[See the AWS documentation website for more details](http://docs.aws.amazon.com/ja_jp/datazone/latest/userguide/snowflake-lineage-glue-spark.html)

   これにより、Spark AWS Glue ランタイムは、 にバンドルされているバージョンではなく、アップロードされた`openlineage-java`クライアントをロードします AWS Glue。

## ステップ 2: AWS Glue ジョブで系統イベント生成を有効にする
<a name="snowflake-lineage-glue-spark-step2"></a>

1.  AWS Glue コンソールでジョブを開き、**ジョブの詳細** → **基本プロパティ**を選択します。

1. **系統イベントの生成**を選択します。

1. 表示されるフィールドに Amazon DataZone **ドメイン ID** を入力します。Snowflake 接続の作成時に使用したのと同じドメイン ID を使用します。

1. ジョブを保存します。

## 系統がキャプチャされていることを確認する
<a name="snowflake-lineage-glue-spark-verify"></a>

 AWS Glue ジョブを実行します。ジョブが完了したら、プロジェクトのターゲットテーブルの Amazon SageMaker Unified Studio で系統ビューを開きます。ジョブによって読み取られた Snowflake ソースの系統レコードは、グラフにアップストリームノードとして表示されます。