

기계 번역으로 제공되는 번역입니다. 제공된 번역과 원본 영어의 내용이 상충하는 경우에는 영어 버전이 우선합니다.

# AWS Glue Spark 작업에 대한 Snowflake 계보 활성화
<a name="snowflake-lineage-glue-spark"></a>

Amazon DataZone은 Snowflake 데이터 소스에서 읽거나 쓰는 AWS Glue Spark 작업에서 열 수준 계보를 캡처할 수 있습니다. AWS Glue 작업에서 계보를 활성화하면 AWS Glue Spark 런타임은 작업이 실행될 때 계보 이벤트를 내보내고 Amazon SageMaker Unified Studio는 계보 보기에서 계보 이벤트를 렌더링합니다.

AWS Glue의 Spark 런타임에는 이벤트를 전송하는 데 사용하는 OpenLineage Spark 및 Amazon DataZone 통합이 이미 포함되어 있습니다. 유일한 추가 단계는 작업의 OpenLineage 코어 클라이언트(`openlineage-java`)를 버전 로 업그레이드하는 것입니다`1.49.0`.

## 사전 조건
<a name="snowflake-lineage-glue-spark-prerequisites"></a>

 AWS Glue Spark 작업에서 계보를 활성화하기 전에 다음을 확인합니다.
+ Snowflake 연결이 이미 구성된 Amazon DataZone 도메인 및 프로젝트입니다. [Amazon DataZone에서 Snowflake를 데이터 소스로 연결](snowflake-data-source.md)을(를) 참조하세요.
+ 연결된 Snowflake 소스에서 읽거나 쓰는 AWS Glue Spark 작업입니다.
+  AWS Glue 작업의 구성을 수정할 수 있는 권한입니다.
+  AWS Glue 작업이 읽을 수 있는 Amazon S3 버킷입니다.

다음 단계에서는 AWS Glue 작업에서 OpenLineage 코어 클라이언트를 업그레이드하고 계보 이벤트 생성을 활성화하는 방법을 설명합니다.

## 1단계: AWS Glue 작업에서 OpenLineage 코어 클라이언트 업그레이드
<a name="snowflake-lineage-glue-spark-step1"></a>

 AWS Glue Spark 런타임은 OpenLineage Spark 통합 및 Amazon DataZone 통합을 번들로 제공합니다. Amazon DataZone과 호환되도록 하려면 작업의 `openlineage-java` 클라이언트를 버전 로 업그레이드합니다`1.49.0`.

1. Maven Central`openlineage-java-1.49.0.jar`에서 다운로드합니다. 다음을 사용하십시오.
   + [Maven 리포지토리 페이지](https://mvnrepository.com/artifact/io.openlineage/openlineage-java/1.49.0). 다운로드할 **jar**을 선택합니다.
   + [직접 Maven URL입니다](https://repo1.maven.org/maven2/io/openlineage/openlineage-java/1.49.0/).

1.  AWS Glue 작업이 읽을 수 있는 Amazon S3 버킷에 JAR을 업로드합니다.

1.  AWS Glue 콘솔에서 작업을 열고 **작업 세부 정보를** 선택합니다. **고급 속성**에서 **종속 JARs 경로를** 찾고 업로드된 JAR의 S3 URI를 추가합니다.

1. 여전히 **작업 세부 정보에** 다음 작업 파라미터를 추가합니다.    
[See the AWS documentation website for more details](http://docs.aws.amazon.com/ko_kr/datazone/latest/userguide/snowflake-lineage-glue-spark.html)

   이렇게 하면 AWS Glue Spark 런타임이와 번들로 제공되는 버전 대신 업로드된 `openlineage-java` 클라이언트를 로드합니다 AWS Glue.

## 2단계: AWS Glue 작업에서 계보 이벤트 생성 활성화
<a name="snowflake-lineage-glue-spark-step2"></a>

1.  AWS Glue 콘솔에서 작업을 열고 **작업 세부 정보** → **기본 속성을** 선택합니다.

1. **계보 이벤트 생성을** 선택합니다.

1. 표시되는 필드에 Amazon DataZone **도메인 ID**를 입력합니다. Snowflake 연결을 생성할 때 사용한 것과 동일한 도메인 ID를 사용합니다.

1. 작업을 저장합니다.

## 계보가 캡처되었는지 확인
<a name="snowflake-lineage-glue-spark-verify"></a>

 AWS Glue 작업을 실행합니다. 작업이 완료되면 Amazon SageMaker Unified Studio에서 프로젝트의 대상 테이블에 대한 계보 보기를 엽니다. 작업에서 읽은 Snowflake 소스의 계보 레코드는 그래프에 업스트림 노드로 표시됩니다.