翻訳は機械翻訳により提供されています。提供された翻訳内容と英語版の間で齟齬、不一致または矛盾がある場合、英語版が優先します。
Spark ジョブの Snowflake AWS Glue 系統を有効にする
Amazon DataZone は、Snowflake データソースとの間で読み書きする Spark AWS Glue ジョブから列レベルの系統をキャプチャできます。 AWS Glue ジョブで系統を有効にすると、 AWS Glue Spark ランタイムはジョブの実行時に系統イベントを出力し、Amazon SageMaker Unified Studio は系統ビューでレンダリングします。
AWS Glueの Spark ランタイムには、イベントの送信に使用する OpenLineage Spark と Amazon DataZone の統合が既に含まれています。唯一の追加ステップは、ジョブの OpenLineage コアクライアント (openlineage-java) をバージョン にアップグレードすることです1.49.0。
前提条件
Spark AWS Glue ジョブで系統を有効にする前に、以下を確認してください。
-
Snowflake 接続が既に設定されている Amazon DataZone ドメインとプロジェクト。「Amazon DataZone でデータソースとして Snowflake を接続する」を参照してください。
-
接続された Snowflake AWS Glue ソースとの間で読み取りまたは書き込みを行う Spark ジョブ。
-
AWS Glue ジョブの設定を変更するアクセス許可。
-
AWS Glue ジョブが読み取ることができる Amazon S3 バケット。
次の手順では、 AWS Glue ジョブで OpenLineage コアクライアントをアップグレードし、系統イベント生成を有効にする方法について説明します。
ステップ 1: AWS Glue ジョブで OpenLineage コアクライアントをアップグレードする
AWS Glue Spark ランタイムは、OpenLineage Spark 統合と Amazon DataZone 統合をバンドルします。Amazon DataZone と互換性を持たせるには、ジョブの openlineage-java クライアントをバージョン にアップグレードします1.49.0。
-
Maven Central
openlineage-java-1.49.0.jarからダウンロードします。次のいずれかを使用してください。-
Maven リポジトリページ
。ダウンロードする jar を選択します。
-
-
AWS Glue ジョブが読み取れる Amazon S3 バケットに JAR をアップロードします。
-
AWS Glue コンソールでジョブを開き、ジョブの詳細を選択します。詳細プロパティで、依存 JARsパスを見つけ、アップロードされた JAR の S3 URI を追加します。
-
ジョブの詳細で、次のジョブパラメータを追加します。
キー 値 --user-jars-firsttrueこれにより、Spark AWS Glue ランタイムは、 にバンドルされているバージョンではなく、アップロードされた
openlineage-javaクライアントをロードします AWS Glue。
ステップ 2: AWS Glue ジョブで系統イベント生成を有効にする
-
AWS Glue コンソールでジョブを開き、ジョブの詳細 → 基本プロパティを選択します。
-
系統イベントの生成を選択します。
-
表示されるフィールドに Amazon DataZone ドメイン ID を入力します。Snowflake 接続の作成時に使用したのと同じドメイン ID を使用します。
-
ジョブを保存します。
系統がキャプチャされていることを確認する
AWS Glue ジョブを実行します。ジョブが完了したら、プロジェクトのターゲットテーブルの Amazon SageMaker Unified Studio で系統ビューを開きます。ジョブによって読み取られた Snowflake ソースの系統レコードは、グラフにアップストリームノードとして表示されます。