View a markdown version of this page

Ative a linhagem Snowflake para AWS Glue Trabalhos do Spark - Amazon DataZone

As traduções são geradas por tradução automática. Em caso de conflito entre o conteúdo da tradução e da versão original em inglês, a versão em inglês prevalecerá.

Ative a linhagem Snowflake para AWS Glue Trabalhos do Spark

A Amazon DataZone pode capturar linhagem em nível de coluna de trabalhos do AWS Glue Spark que leem ou gravam em uma fonte de dados do Snowflake. Quando você ativa a linhagem no AWS Glue trabalho, o tempo de execução do AWS Glue Spark emite eventos de linhagem à medida que o trabalho é executado e o Amazon SageMaker Unified Studio os renderiza na visualização de linhagem.

AWS Glue O tempo de execução do Spark já inclui as DataZone integrações do OpenLineage Spark e da Amazon que ele usa para enviar eventos. A única etapa adicional é atualizar o cliente OpenLineage principal (openlineage-java) no trabalho para a versão1.49.0.

Pré-requisitos

Antes de ativar a linhagem em uma tarefa do AWS Glue Spark, confirme o seguinte:

  • Um DataZone domínio e projeto da Amazon com uma conexão Snowflake já configurada. Consulte Connect Snowflake como fonte de dados na Amazon DataZone.

  • Uma tarefa AWS Glue do Spark que lê ou grava na fonte conectada do Snowflake.

  • Permissão para modificar a configuração do AWS Glue trabalho.

  • Um bucket do Amazon S3 que o AWS Glue trabalho pode ler.

As etapas a seguir descrevem como atualizar o cliente OpenLineage principal no AWS Glue trabalho e habilitar a geração de eventos de linhagem.

Etapa 1: atualizar o cliente OpenLineage principal no AWS Glue trabalho

O tempo de execução do AWS Glue Spark agrupa a integração com o OpenLineage Spark e a integração com a Amazon. DataZone Para torná-lo compatível com a Amazon DataZone, atualize o openlineage-java cliente no trabalho para a versão1.49.0.

  1. Baixe openlineage-java-1.49.0.jar do Maven Central. Use:

  2. Faça o upload do JAR em um bucket do Amazon S3 que seu AWS Glue trabalho possa ler.

  3. No AWS Glue console, abra o trabalho e escolha Detalhes do trabalho. Em Propriedades avançadas, encontre o caminho dos JARs dependentes e adicione o URI do S3 do JAR carregado.

  4. Ainda em Detalhes do trabalho, adicione o seguinte parâmetro do trabalho:

    Chave Valor
    --user-jars-first true

    Isso faz com que o tempo de execução do AWS Glue Spark carregue seu openlineage-java cliente carregado em vez da versão incluída. AWS Glue

Etapa 2: Habilitar a geração de eventos de linhagem no AWS Glue trabalho

  1. No AWS Glue console, abra o trabalho e escolha Detalhes do trabalhoPropriedades básicas.

  2. Selecione Gerar eventos de linhagem.

  3. Insira seu ID de DataZone domínio da Amazon no campo exibido. Use o mesmo ID de domínio usado ao criar a conexão do Snowflake.

  4. Salve o emprego.

Verifique se a linhagem foi capturada

Execute o AWS Glue trabalho. Depois que o trabalho for concluído, abra a visualização de linhagem no Amazon SageMaker Unified Studio para a tabela de destino em seu projeto. Os registros de linhagem das fontes do Snowflake lidas pela tarefa aparecem como nós ascendentes no gráfico.