View a markdown version of this page

啟用 AWS Glue Spark 任務的 Snowflake 歷程 - Amazon DataZone

本文為英文版的機器翻譯版本,如內容有任何歧義或不一致之處,概以英文版為準。

啟用 AWS Glue Spark 任務的 Snowflake 歷程

Amazon DataZone 可以從讀取或寫入 Snowflake 資料來源的 AWS Glue Spark 任務擷取資料欄層級歷程。當您在 AWS Glue 任務上啟用歷程記錄時, AWS Glue Spark 執行時間會在任務執行時發出歷程記錄事件,而 Amazon SageMaker Unified Studio 會在歷程記錄檢視中轉譯這些事件。

AWS Glue的 Spark 執行期已包含用於傳送事件的 OpenLineage Spark 和 Amazon DataZone 整合。唯一的額外步驟是將任務上的 OpenLineage 核心用戶端 (openlineage-java) 升級至版本 1.49.0

先決條件

在 AWS Glue Spark 任務上啟用歷程記錄之前,請確認下列事項:

  • 已設定具有 Snowflake 連線的 Amazon DataZone 網域和專案。請參閱 將 Snowflake 連接為 Amazon DataZone 中的資料來源

  • 從連線的 Snowflake 來源讀取或寫入的 AWS Glue Spark 任務。

  • 修改 AWS Glue 任務組態的許可。

  • AWS Glue 任務可以讀取的 Amazon S3 儲存貯體。

下列步驟說明如何升級 AWS Glue 任務上的 OpenLineage 核心用戶端,並啟用歷程事件產生。

步驟 1:升級 AWS Glue 任務上的 OpenLineage 核心用戶端

AWS Glue Spark 執行時間會綁定 OpenLineage Spark 整合和 Amazon DataZone 整合。若要使其與 Amazon DataZone 相容,請將任務上的openlineage-java用戶端升級至版本 1.49.0

  1. openlineage-java-1.49.0.jar 從 Maven Central 下載。使用以下任一項:

  2. 將 JAR 上傳至 AWS Glue 任務可以讀取的 Amazon S3 儲存貯體。

  3. 在 AWS Glue 主控台中,開啟任務,然後選擇任務詳細資訊。在進階屬性下,尋找相依 JARs 路徑,並新增上傳 JAR 的 S3 URI。

  4. 仍在任務詳細資訊中,新增下列任務參數:

    金鑰
    --user-jars-first true

    這會使 AWS Glue Spark 執行期載入您上傳的openlineage-java用戶端,而不是與 綁定的版本 AWS Glue。

步驟 2:在 AWS Glue 任務上啟用歷程事件產生

  1. 在 AWS Glue 主控台中,開啟任務,然後選擇任務詳細資訊基本屬性

  2. 選取產生歷程事件

  3. 在出現的欄位中輸入您的 Amazon DataZone 網域 ID。使用您在建立 Snowflake 連線時使用的相同網域 ID。

  4. 儲存任務。

確認已擷取歷程記錄

執行 AWS Glue 任務。任務完成後,請在 Amazon SageMaker Unified Studio 中開啟專案中目標資料表的歷程檢視。任務讀取的 Snowflake 來源的歷程記錄會顯示為圖形中的上游節點。