View a markdown version of this page

Tipos de arquivo compatíveis com fontes de dados - AWS Glue DataBrew Guia do Desenvolvedor

As traduções são geradas por tradução automática. Em caso de conflito entre o conteúdo da tradução e da versão original em inglês, a versão em inglês prevalecerá.

Tipos de arquivo compatíveis com fontes de dados

Os requisitos de arquivo a seguir se aplicam aos arquivos armazenados no Amazon S3 e aos arquivos que você carrega de uma unidade local. DataBrew suporta os seguintes formatos de arquivo: valor separado por vírgula (CSV), Microsoft Excel, JSON, ORC e Parquet. Você pode usar arquivos com uma extensão não padrão ou sem extensão se o arquivo for de um dos tipos suportados.

Se não DataBrew for possível inferir o tipo de arquivo, certifique-se de selecionar você mesmo o tipo de arquivo correto (CSV, Excel, JSON, ORC ou Parquet). Há suporte para arquivos CSV, JSON, ORC e Parquet compactados, mas os arquivos CSV e JSON devem incluir o codec de compactação como extensão do arquivo. Se você estiver importando uma pasta, todos os arquivos na pasta deverão ser do mesmo tipo de arquivo.

Os formatos de arquivo e os algoritmos de compactação compatíveis são mostrados na tabela a seguir.

nota

Arquivos CSV, Excel e JSON devem ser codificados com Unicode (). UTF-8

Formato Extensão do arquivo (opcional) Extensões para arquivos compactados (obrigatório)

Comma-separated valores

.csv

.gz

.snappy

.lz4

.bz2

.deflate

Pasta de trabalho do Microsoft Excel

.xlsx

Sem suporte para compressão

JSON (documento JSON e linhas JSON)

.json, .jsonl

.gz

.snappy

.lz4

.bz2

.deflate

Apache ORC

.orc

.zlib

.snappy

Apache Parquet

.parquet

.gz

.snappy

.lz4