As traduções são geradas por tradução automática. Em caso de conflito entre o conteúdo da tradução e da versão original em inglês, a versão em inglês prevalecerá.
Ative a linhagem Snowflake para AWS Glue Trabalhos do Spark
A Amazon DataZone pode capturar linhagem em nível de coluna de trabalhos do AWS Glue Spark que leem ou gravam em uma fonte de dados do Snowflake. Quando você ativa a linhagem no AWS Glue trabalho, o tempo de execução do AWS Glue Spark emite eventos de linhagem à medida que o trabalho é executado e o Amazon SageMaker Unified Studio os renderiza na visualização de linhagem.
AWS Glue O tempo de execução do Spark já inclui as DataZone integrações do OpenLineage Spark e da Amazon que ele usa para enviar eventos. A única etapa adicional é atualizar o cliente OpenLineage principal (openlineage-java) no trabalho para a versão1.49.0.
Pré-requisitos
Antes de ativar a linhagem em uma tarefa do AWS Glue Spark, confirme o seguinte:
-
Um DataZone domínio e projeto da Amazon com uma conexão Snowflake já configurada. Consulte Connect Snowflake como fonte de dados na Amazon DataZone.
-
Uma tarefa AWS Glue do Spark que lê ou grava na fonte conectada do Snowflake.
-
Permissão para modificar a configuração do AWS Glue trabalho.
-
Um bucket do Amazon S3 que o AWS Glue trabalho pode ler.
As etapas a seguir descrevem como atualizar o cliente OpenLineage principal no AWS Glue trabalho e habilitar a geração de eventos de linhagem.
Etapa 1: atualizar o cliente OpenLineage principal no AWS Glue trabalho
O tempo de execução do AWS Glue Spark agrupa a integração com o OpenLineage Spark e a integração com a Amazon. DataZone Para torná-lo compatível com a Amazon DataZone, atualize o openlineage-java cliente no trabalho para a versão1.49.0.
-
Baixe
openlineage-java-1.49.0.jardo Maven Central. Use:-
A página do Repositório Maven
. Escolha jar para baixar.
-
-
Faça o upload do JAR em um bucket do Amazon S3 que seu AWS Glue trabalho possa ler.
-
No AWS Glue console, abra o trabalho e escolha Detalhes do trabalho. Em Propriedades avançadas, encontre o caminho dos JARs dependentes e adicione o URI do S3 do JAR carregado.
-
Ainda em Detalhes do trabalho, adicione o seguinte parâmetro do trabalho:
Chave Valor --user-jars-firsttrueIsso faz com que o tempo de execução do AWS Glue Spark carregue seu
openlineage-javacliente carregado em vez da versão incluída. AWS Glue
Etapa 2: Habilitar a geração de eventos de linhagem no AWS Glue trabalho
-
No AWS Glue console, abra o trabalho e escolha Detalhes do trabalho → Propriedades básicas.
-
Selecione Gerar eventos de linhagem.
-
Insira seu ID de DataZone domínio da Amazon no campo exibido. Use o mesmo ID de domínio usado ao criar a conexão do Snowflake.
-
Salve o emprego.
Verifique se a linhagem foi capturada
Execute o AWS Glue trabalho. Depois que o trabalho for concluído, abra a visualização de linhagem no Amazon SageMaker Unified Studio para a tabela de destino em seu projeto. Os registros de linhagem das fontes do Snowflake lidas pela tarefa aparecem como nós ascendentes no gráfico.