View a markdown version of this page

Types de fichiers pris en charge pour les sources de données - AWS Glue DataBrew Guide du développeur

Les traductions sont fournies par des outils de traduction automatique. En cas de conflit entre le contenu d'une traduction et celui de la version originale en anglais, la version anglaise prévaudra.

Types de fichiers pris en charge pour les sources de données

Les exigences suivantes s'appliquent aux fichiers stockés dans Amazon S3 et aux fichiers que vous chargez depuis un disque local. DataBrew prend en charge les formats de fichier suivants : valeur séparée par des virgules (CSV), Microsoft Excel, JSON, ORC et Parquet. Vous pouvez utiliser des fichiers avec une extension non standard ou sans extension s'ils appartiennent à l'un des types pris en charge.

S'il n' DataBrew est pas possible de déduire le type de fichier, assurez-vous de sélectionner vous-même le bon type de fichier (CSV, Excel, JSON, ORC ou Parquet). Les fichiers CSV, JSON, ORC et Parquet compressés sont pris en charge, mais les fichiers CSV et JSON doivent inclure le codec de compression comme extension de fichier. Si vous importez un dossier, tous les fichiers qu'il contient doivent être du même type.

Les formats de fichiers et les algorithmes de compression pris en charge sont présentés dans le tableau suivant.

Note

Les fichiers CSV, Excel et JSON doivent être codés avec Unicode (UTF-8).

Format Extension de fichier (facultatif) Extensions pour les fichiers compressés (obligatoire)

Comma-separated valeurs

.csv

.gz

.snappy

.lz4

.bz2

.deflate

classeur Microsoft Excel

.xlsx

Aucun support de compression

JSON (document JSON et lignes JSON)

.json, .jsonl

.gz

.snappy

.lz4

.bz2

.deflate

Apache ORC

.orc

.zlib

.snappy

Apache Parquet

.parquet

.gz

.snappy

.lz4