View a markdown version of this page

Conexões suportadas para fontes e saídas de dados - AWS Glue DataBrew Guia do Desenvolvedor

As traduções são geradas por tradução automática. Em caso de conflito entre o conteúdo da tradução e da versão original em inglês, a versão em inglês prevalecerá.

Conexões suportadas para fontes e saídas de dados

Você pode se conectar às seguintes fontes de dados para tarefas de DataBrew receitas. Isso inclui qualquer fonte de dados que não seja um arquivo para DataBrew o qual você está enviando diretamente. A fonte de dados que você está usando pode ser chamada de banco de dados, data warehouse ou outra coisa. Nós nos referimos a todos os provedores de dados como fontes de dados ou conexões.

Você pode criar um conjunto de dados usando qualquer um dos itens a seguir como fontes de dados.

Você também pode usar bancos de dados Amazon S3 ou JDBC suportados pelo Amazon RDS para a saída de trabalhos de receitas.AWS Glue Data Catalog DataBrew Amazon AppFlow e AWS Data Exchange não são suportados armazenamentos de dados para a produção de trabalhos de DataBrew receitas.

  • Amazon S3

    Você pode usar o S3 para armazenar e proteger qualquer quantidade de dados. Para criar um conjunto de dados, você especifica uma URL do S3 onde DataBrew pode acessar um arquivo de dados, por exemplo: s3://your-bucket-name/inventory-data.csv

    DataBrew também pode ler todos os arquivos em uma pasta do S3, o que significa que você pode criar um conjunto de dados que abranja vários arquivos. Para fazer isso, especifique um URL do S3 neste formato:s3://your-bucket-name/your-folder-name/.

    DataBrew suporta somente as seguintes classes de armazenamento do Amazon S3: Standard, Reduced Redundancy e S3 One Standard-IA. Zone-IA DataBrew ignora arquivos com outras classes de armazenamento. DataBrew também ignora arquivos vazios (arquivos contendo 0 bytes). Para obter mais informações sobre as classes de armazenamento do Amazon S3, consulte Usando as classes de armazenamento do Amazon S3 no Guia do usuário do console do Amazon S3.

  • AWS Glue Data Catalog

    Você pode usar o Catálogo de Dados para definir referências aos dados armazenados na AWS nuvem. Com o Catálogo de Dados, você pode criar conexões com tabelas individuais nos seguintes serviços:

    • Catálogo de dados Amazon S3

    • Catálogo de dados Amazon Redshift

    • Catálogo de dados Amazon RDS

    • AWS Glue

    DataBrew também pode ler todos os arquivos em uma pasta do Amazon S3, o que significa que você pode criar um conjunto de dados que abrange vários arquivos. Para fazer isso, especifique uma URL do Amazon S3 neste formato: s3://your-bucket-name/your-folder-name/

    Para serem usadas com DataBrew, as tabelas do Amazon S3 definidas no AWS Glue Data Catalog, devem ter uma propriedade de tabela adicionada a elas chamada aclassification, que identifica o formato dos dados comocsv, jsonparquet, ou e como. typeOfData file Se a propriedade da tabela não tiver sido adicionada quando a tabela foi criada, você poderá adicioná-la usando o AWS Glue console.

    DataBrew suporta somente as classes de armazenamento Standard, Reduced Redundancy e S3 One do Amazon S3. Standard-IA Zone-IA DataBrew ignora arquivos com outras classes de armazenamento. DataBrew também ignora arquivos vazios (arquivos contendo 0 bytes). Para obter mais informações sobre as classes de armazenamento do Amazon S3, consulte Usando as classes de armazenamento do Amazon S3 no Guia do usuário do console do Amazon S3.

    DataBrew também pode acessar tabelas do AWS Glue Data Catalog S3 de outras contas se uma política de recursos apropriada for criada. Você pode criar uma política no AWS Glue console na guia Configurações em Catálogo de dados. A seguir está um exemplo de política específica para um único Região da AWS.

    Atenção

    Esta é uma política de recursos altamente permissiva que concede acesso *$ACCOUNT_TO* irrestrito ao Catálogo de Dados de. *$ACCOUNT_FROM* Na maioria dos casos, recomendamos que você restrinja sua política de recursos a catálogos ou tabelas específicos. Para obter mais informações, consulte as políticas de AWS Glue recursos para controle de acesso no Guia do AWS Glue desenvolvedor.

    Em alguns casos, talvez você queira criar um projeto ou executar um trabalho *$ACCOUNT_TO* com uma tabela do Catálogo de AWS Glue Dados do S3 *$ACCOUNT_FROM* que aponta para um local do S3 que também está em.AWS Glue DataBrew*$ACCOUNT_FROM* Nesses casos, a função do IAM usada ao criar o projeto e o trabalho em *$ACCOUNT_TO* deve ter permissão para listar e obter objetos desse local do *$ACCOUNT_FROM* S3. Para obter mais informações, consulte Conceder acesso entre contas no Guia do AWS Glue desenvolvedor.

  • Dados conectados usando drivers JDBC

    Você pode criar um conjunto de dados conectando-se aos dados com um driver JDBC compatível. Para obter mais informações, consulte Usando drivers com AWS Glue DataBrew.

    DataBrew suporta oficialmente as seguintes fontes de dados usando Java Database Connectivity (JDBC):

    • Microsoft SQL Server

    • MySQL

    • Oracle

    • PostgreSQL

    • banco de dados de origem

    • Conector Snowflake para Spark

    As fontes de dados podem estar localizadas em qualquer lugar de onde você possa se conectar a elas DataBrew. Essa lista inclui somente conexões JDBC que testamos e, portanto, podemos oferecer suporte.

    As fontes de dados do Amazon Redshift e do Snowflake Connector para Spark podem ser conectadas de uma das seguintes formas:

    • Com um nome de tabela.

    • Com uma consulta SQL que abrange várias tabelas e operações.

    As consultas SQL são executadas quando você inicia um projeto ou a execução de um trabalho.

    Para se conectar a dados que exijam um driver JDBC não listado, verifique se o driver é compatível com o JDK 8. Para usar o driver, armazene-o no S3 em um bucket onde você possa acessá-lo com sua função do IAM. DataBrew Em seguida, aponte seu conjunto de dados para o arquivo do driver. Para obter mais informações, consulte Usando drivers com AWS Glue DataBrew.

    Exemplo de consulta para um SQL-based conjunto de dados:

    SELECT * FROM public.customer as c JOIN public.customer_address as ca on c.current_address=ca.current_address WHERE ca.address_id>0 AND ca.address_id<10001 ORDER BY ca.address_id

    Limitações do SQL personalizado

    Se você usa uma conexão JDBC para acessar dados de um DataBrew conjunto de dados, lembre-se do seguinte:

    • AWS Glue DataBrew não valida o SQL personalizado que você fornece como parte da criação do conjunto de dados. A consulta SQL será executada quando você iniciar um projeto ou execução de um trabalho. DataBrew pega a consulta fornecida e a passa para o mecanismo de banco de dados usando os drivers JDBC padrão ou fornecidos.

    • Um conjunto de dados criado com uma consulta inválida falhará quando for usado em um projeto ou trabalho. Valide sua consulta antes de criar o conjunto de dados.

    • O recurso Validate SQL está disponível somente para fontes de Redshift-based dados da Amazon.

    • Se você quiser usar um conjunto de dados em um projeto, limite o tempo de execução da consulta SQL a menos de três minutos para evitar um tempo limite durante o carregamento do projeto. Verifique o tempo de execução da consulta antes de criar um projeto.

  • Amazon AppFlow

    Usando a Amazon AppFlow, você pode transferir dados para o Amazon S3 a partir de aplicativos de terceiros ( Software-as-a-Service SaaS), como Salesforce, Zendesk, Slack e. ServiceNow Em seguida, você pode usar os dados para criar um DataBrew conjunto de dados.

    Na Amazon AppFlow, você cria uma conexão e um fluxo para transferir dados entre seu aplicativo de terceiros e um aplicativo de destino. Ao usar a Amazon AppFlow com DataBrew, certifique-se de que o aplicativo de AppFlow destino da Amazon seja o Amazon S3. Aplicativos de AppFlow destino da Amazon que não sejam o Amazon S3 não aparecem no DataBrew console. Para obter mais informações sobre a transferência de dados de seu aplicativo de terceiros e a criação de AppFlow conexões e fluxos da Amazon, consulte a AppFlow documentação da Amazon.

    Quando você escolhe Connect new dataset na guia Datasets DataBrew e clica em Amazon AppFlow, você vê todos os fluxos na Amazon AppFlow que estão configurados com o Amazon S3 como aplicativo de destino. Para usar os dados de um fluxo para seu conjunto de dados, escolha esse fluxo.

    Escolher Criar fluxo, Gerenciar fluxos e Visualizar detalhes da Amazon AppFlow no DataBrew console abre o AppFlow console da Amazon para que você possa realizar essas tarefas.

    Depois de criar um conjunto de dados da Amazon AppFlow, você pode executar o fluxo e visualizar os detalhes mais recentes da execução do fluxo ao visualizar os detalhes do conjunto de dados ou do trabalho. Quando você executa o fluxo DataBrew, o conjunto de dados é atualizado no S3 e está pronto para ser usado. DataBrew

    As seguintes situações podem surgir quando você seleciona um AppFlow fluxo da Amazon no DataBrew console para criar um conjunto de dados:

    • Os dados não foram agregados — se o gatilho do fluxo for Executar sob demanda ou for Executado dentro do cronograma com transferência total de dados, certifique-se de agregar os dados do fluxo antes de usá-los para criar um DataBrew conjunto de dados. A agregação do fluxo combina todos os registros no fluxo em um único arquivo. Fluxos com o tipo de acionador Executar conforme agendamento com transferência incremental de dados ou Executar em evento não exigem agregação. Para agregar dados na Amazon AppFlow, escolha Editar configuração de fluxo > Detalhes do destino > Configurações adicionais > Preferência de transferência de dados.

    • O fluxo não foi executado - se o status de execução de um fluxo estiver vazio, isso significa um dos seguintes:

      • Se o gatilho para executar o fluxo for Executar sob demanda, o fluxo ainda não foi executado.

      • Se o gatilho para executar o fluxo for Executar no evento, o evento acionador ainda não ocorreu.

      • Se o gatilho para executar o fluxo for Executar dentro do cronograma, uma execução programada ainda não ocorreu.

      Antes de criar um conjunto de dados com um fluxo, escolha Executar fluxo para esse fluxo.

      Para obter mais informações, consulte AppFlow os fluxos da Amazon no Guia AppFlow do usuário da Amazon.

  • AWS Data Exchange

    Você pode escolher entre centenas de fontes de dados de terceiros que estão disponíveis em AWS Data Exchange. Ao assinar essas fontes de dados, você obtém a versão mais atualizada dos dados.

    Para criar um conjunto de dados, você especifica o nome de um produto de AWS Data Exchange dados que você está inscrito e tem o direito de usar.