View a markdown version of this page

Tipos de archivos compatibles para las fuentes de datos - AWS Glue DataBrew Guía para desarrolladores

Las traducciones son generadas a través de traducción automática. En caso de conflicto entre la traducción y la version original de inglés, prevalecerá la version en inglés.

Tipos de archivos compatibles para las fuentes de datos

Los siguientes requisitos de archivos se aplican a los archivos almacenados en Amazon S3 y a los archivos que carga desde una unidad local. DataBrew admite los siguientes formatos de archivo: valores separados por comas (CSV), Microsoft Excel, JSON, ORC y Parquet. Puede utilizar archivos con una extensión no estándar o sin extensión si el archivo es de uno de los tipos admitidos.

Si DataBrew no puede deducir el tipo de archivo, asegúrese de seleccionar usted mismo el tipo de archivo correcto (CSV, Excel, JSON, ORC o Parquet). Se admiten los archivos CSV, JSON, ORC y Parquet comprimidos, pero los archivos CSV y JSON deben incluir el códec de compresión como extensión del archivo. Si va a importar una carpeta, todos los archivos de la carpeta deben ser del mismo tipo de archivo.

Los formatos de archivo y los algoritmos de compresión compatibles se muestran en la siguiente tabla.

nota

Los archivos CSV, Excel y JSON deben estar codificados con Unicode (UTF-8).

Formato Extensión de archivo (opcional) Extensiones para archivos comprimidos (obligatorias)

Comma-separated valores

.csv

.gz

.snappy

.lz4

.bz2

.deflate

Libro de trabajo de Microsoft Excel

.xlsx

Sin soporte de compresión

JSON (documento JSON y líneas JSON)

.json, .jsonl

.gz

.snappy

.lz4

.bz2

.deflate

Apache ORC

.orc

.zlib

.snappy

Apache Parquet

.parquet

.gz

.snappy

.lz4