View a markdown version of this page

AWS Glue Spark 작업에 대한 Snowflake 계보 활성화 - Amazon DataZone

기계 번역으로 제공되는 번역입니다. 제공된 번역과 원본 영어의 내용이 상충하는 경우에는 영어 버전이 우선합니다.

AWS Glue Spark 작업에 대한 Snowflake 계보 활성화

Amazon DataZone은 Snowflake 데이터 소스에서 읽거나 쓰는 AWS Glue Spark 작업에서 열 수준 계보를 캡처할 수 있습니다. AWS Glue 작업에서 계보를 활성화하면 AWS Glue Spark 런타임은 작업이 실행될 때 계보 이벤트를 내보내고 Amazon SageMaker Unified Studio는 계보 보기에서 계보 이벤트를 렌더링합니다.

AWS Glue의 Spark 런타임에는 이벤트를 전송하는 데 사용하는 OpenLineage Spark 및 Amazon DataZone 통합이 이미 포함되어 있습니다. 유일한 추가 단계는 작업의 OpenLineage 코어 클라이언트(openlineage-java)를 버전 로 업그레이드하는 것입니다1.49.0.

사전 조건

AWS Glue Spark 작업에서 계보를 활성화하기 전에 다음을 확인합니다.

  • Snowflake 연결이 이미 구성된 Amazon DataZone 도메인 및 프로젝트입니다. Amazon DataZone에서 Snowflake를 데이터 소스로 연결을(를) 참조하세요.

  • 연결된 Snowflake 소스에서 읽거나 쓰는 AWS Glue Spark 작업입니다.

  • AWS Glue 작업의 구성을 수정할 수 있는 권한입니다.

  • AWS Glue 작업이 읽을 수 있는 Amazon S3 버킷입니다.

다음 단계에서는 AWS Glue 작업에서 OpenLineage 코어 클라이언트를 업그레이드하고 계보 이벤트 생성을 활성화하는 방법을 설명합니다.

1단계: AWS Glue 작업에서 OpenLineage 코어 클라이언트 업그레이드

AWS Glue Spark 런타임은 OpenLineage Spark 통합 및 Amazon DataZone 통합을 번들로 제공합니다. Amazon DataZone과 호환되도록 하려면 작업의 openlineage-java 클라이언트를 버전 로 업그레이드합니다1.49.0.

  1. Maven Centralopenlineage-java-1.49.0.jar에서 다운로드합니다. 다음을 사용하십시오.

  2. AWS Glue 작업이 읽을 수 있는 Amazon S3 버킷에 JAR을 업로드합니다.

  3. AWS Glue 콘솔에서 작업을 열고 작업 세부 정보를 선택합니다. 고급 속성에서 종속 JARs 경로를 찾고 업로드된 JAR의 S3 URI를 추가합니다.

  4. 여전히 작업 세부 정보에 다음 작업 파라미터를 추가합니다.

    Key(키)
    --user-jars-first true

    이렇게 하면 AWS Glue Spark 런타임이와 번들로 제공되는 버전 대신 업로드된 openlineage-java 클라이언트를 로드합니다 AWS Glue.

2단계: AWS Glue 작업에서 계보 이벤트 생성 활성화

  1. AWS Glue 콘솔에서 작업을 열고 작업 세부 정보기본 속성을 선택합니다.

  2. 계보 이벤트 생성을 선택합니다.

  3. 표시되는 필드에 Amazon DataZone 도메인 ID를 입력합니다. Snowflake 연결을 생성할 때 사용한 것과 동일한 도메인 ID를 사용합니다.

  4. 작업을 저장합니다.

계보가 캡처되었는지 확인

AWS Glue 작업을 실행합니다. 작업이 완료되면 Amazon SageMaker Unified Studio에서 프로젝트의 대상 테이블에 대한 계보 보기를 엽니다. 작업에서 읽은 Snowflake 소스의 계보 레코드는 그래프에 업스트림 노드로 표시됩니다.