View a markdown version of this page

Qu'est-ce que AWS Glue DataBrew? - AWS Glue DataBrew Guide du développeur

Les traductions sont fournies par des outils de traduction automatique. En cas de conflit entre le contenu d'une traduction et celui de la version originale en anglais, la version anglaise prévaudra.

Qu'est-ce que AWS Glue DataBrew?

AWS Glue DataBrew est un outil visuel de préparation des données qui permet aux utilisateurs de nettoyer et de normaliser les données sans écrire de code. L'utilisation DataBrew permet de réduire le temps nécessaire à la préparation des données pour l'analyse et l'apprentissage automatique (ML) jusqu'à 80 %, par rapport à une préparation de données développée sur mesure. Vous pouvez choisir parmi plus de 250 transformations prêtes à l'emploi pour automatiser les tâches de préparation des données, telles que le filtrage des anomalies, la conversion des données dans des formats standard et la correction de valeurs non valides.

Grâce à DataBrew cela, les analystes commerciaux, les scientifiques des données et les ingénieurs de données peuvent collaborer plus facilement pour obtenir des informations à partir de données brutes. Grâce DataBrew à la technologie sans serveur, quel que soit votre niveau technique, vous pouvez explorer et transformer des téraoctets de données brutes sans avoir à créer de clusters ni à gérer d'infrastructure.

Grâce à l' DataBrew interface intuitive, vous pouvez découvrir, visualiser, nettoyer et transformer les données brutes de manière interactive. DataBrew fait des suggestions intelligentes pour vous aider à identifier les problèmes de qualité des données qui peuvent être difficiles à détecter et fastidieux à résoudre. En DataBrew préparant vos données, vous pouvez utiliser votre temps pour agir sur les résultats et itérer plus rapidement. Vous pouvez enregistrer la transformation sous forme d'étapes dans une recette, que vous pouvez mettre à jour ou réutiliser ultérieurement avec d'autres ensembles de données, et déployer de manière continue.

L'image suivante montre comment DataBrew fonctionne à un niveau élevé.

Un schéma simple illustrant le DataBrew fonctionnement. DataBrew peut nettoyer, préparer et transformer visuellement les données sans avoir à écrire de code. Une boîte indique les données saisies DataBrew depuis Amazon S3. Il montre des cases pour quelques-unes des transformations que DataBrew vous pouvez effectuer. Les zones de transformation incluent les éléments suivants : Formater, nettoyer et standardiser les données. Restructurez et transformez les données. Gérez les données manquantes et non valides. Gérez les variables catégorielles. Gérez les variables numériques. Utilisez le traitement du langage naturel. Le diagramme montre que les données sont exportées vers S3 sous forme de jeu de données préparé.

Pour l'utiliser DataBrew, vous créez un projet et vous connectez à vos données. Dans l'espace de travail du projet, vos données sont affichées dans une interface visuelle semblable à une grille. Ici, vous pouvez explorer les données et consulter les distributions de valeurs et les graphiques pour comprendre leur profil.

Pour préparer les données, vous pouvez choisir parmi plus de 250 transformations pointer-cliquer. Il s'agit notamment de supprimer les valeurs nulles, de remplacer les valeurs manquantes, de corriger les incohérences du schéma, de créer des colonnes basées sur des fonctions, etc. Vous pouvez également utiliser des transformations pour appliquer des techniques de traitement du langage naturel (NLP) afin de diviser des phrases en phrases. Les aperçus immédiats montrent une partie de vos données avant et après la transformation, afin que vous puissiez modifier votre recette avant de l'appliquer à l'ensemble de données.

Après DataBrew avoir exécuté votre recette sur votre ensemble de données, la sortie est stockée dans Amazon Simple Storage Service (Amazon S3). Une fois que votre ensemble de données nettoyé et préparé est dans Amazon S3, un autre de vos systèmes de stockage ou de gestion des données peut l'ingérer.