Les traductions sont fournies par des outils de traduction automatique. En cas de conflit entre le contenu d'une traduction et celui de la version originale en anglais, la version anglaise prévaudra.
Qu'est-ce que AWS Glue DataBrew?
AWS Glue DataBrew est un outil visuel de préparation des données qui permet aux utilisateurs de nettoyer et de normaliser les données sans écrire de code. L'utilisation DataBrew permet de réduire le temps nécessaire à la préparation des données pour l'analyse et l'apprentissage automatique (ML) jusqu'à 80 %, par rapport à une préparation de données développée sur mesure. Vous pouvez choisir parmi plus de 250 transformations prêtes à l'emploi pour automatiser les tâches de préparation des données, telles que le filtrage des anomalies, la conversion des données dans des formats standard et la correction de valeurs non valides.
Grâce à DataBrew cela, les analystes commerciaux, les scientifiques des données et les ingénieurs de données peuvent collaborer plus facilement pour obtenir des informations à partir de données brutes. Grâce DataBrew à la technologie sans serveur, quel que soit votre niveau technique, vous pouvez explorer et transformer des téraoctets de données brutes sans avoir à créer de clusters ni à gérer d'infrastructure.
Grâce à l' DataBrew interface intuitive, vous pouvez découvrir, visualiser, nettoyer et transformer les données brutes de manière interactive. DataBrew fait des suggestions intelligentes pour vous aider à identifier les problèmes de qualité des données qui peuvent être difficiles à détecter et fastidieux à résoudre. En DataBrew préparant vos données, vous pouvez utiliser votre temps pour agir sur les résultats et itérer plus rapidement. Vous pouvez enregistrer la transformation sous forme d'étapes dans une recette, que vous pouvez mettre à jour ou réutiliser ultérieurement avec d'autres ensembles de données, et déployer de manière continue.
L'image suivante montre comment DataBrew fonctionne à un niveau élevé.
Pour l'utiliser DataBrew, vous créez un projet et vous connectez à vos données. Dans l'espace de travail du projet, vos données sont affichées dans une interface visuelle semblable à une grille. Ici, vous pouvez explorer les données et consulter les distributions de valeurs et les graphiques pour comprendre leur profil.
Pour préparer les données, vous pouvez choisir parmi plus de 250 transformations pointer-cliquer. Il s'agit notamment de supprimer les valeurs nulles, de remplacer les valeurs manquantes, de corriger les incohérences du schéma, de créer des colonnes basées sur des fonctions, etc. Vous pouvez également utiliser des transformations pour appliquer des techniques de traitement du langage naturel (NLP) afin de diviser des phrases en phrases. Les aperçus immédiats montrent une partie de vos données avant et après la transformation, afin que vous puissiez modifier votre recette avant de l'appliquer à l'ensemble de données.
Après DataBrew avoir exécuté votre recette sur votre ensemble de données, la sortie est stockée dans Amazon Simple Storage Service (Amazon S3). Une fois que votre ensemble de données nettoyé et préparé est dans Amazon S3, un autre de vos systèmes de stockage ou de gestion des données peut l'ingérer.