Les traductions sont fournies par des outils de traduction automatique. En cas de conflit entre le contenu d'une traduction et celui de la version originale en anglais, la version anglaise prévaudra.
Création et utilisation de AWS Glue DataBrew emplois de profil
Les tâches de profilage exécutent une série d'évaluations sur un ensemble de données et transmettent les résultats à Amazon S3. Les informations collectées par le profilage des données vous aident à comprendre votre ensemble de données et à décider du type d'étapes de préparation des données que vous souhaiterez peut-être exécuter dans vos tâches de recette.
La méthode la plus simple pour exécuter une tâche de profilage consiste à utiliser les DataBrew paramètres par défaut. Vous pouvez configurer votre tâche de profil avant de l'exécuter afin qu'elle renvoie uniquement les informations souhaitées.
Utilisez la procédure suivante pour créer une tâche DataBrew de profil.
Pour créer un profil d'emploi
Connectez-vous à la DataBrew console AWS Management Console et ouvrez-la à l'adresse https://console.aws.amazon.com/databrew/
. Choisissez JOBS dans le volet de navigation, choisissez l'onglet Profile jobs, puis choisissez Create job.
-
Entrez un nom pour votre travail, puis choisissez Créer un profil d'emploi.
Pour la saisie Job, indiquez le nom de l'ensemble de données à profiler.
(Facultatif) Configurez les éléments suivants dans le volet de configuration des profils de données :
-
Configurations au niveau du jeu de données : configurez les détails de votre tâche de profil pour toutes les colonnes de votre ensemble de données.
Vous pouvez éventuellement activer la capacité de détecter et de compter les lignes dupliquées dans le jeu de données. Vous pouvez également choisir Activer la matrice de corrélations et sélectionner des colonnes pour voir dans quelle mesure les valeurs de plusieurs colonnes sont étroitement liées. Pour plus de détails sur les statistiques que vous pouvez configurer au niveau du jeu de données, consultezStatistiques configurables au niveau du jeu de données. Vous pouvez configurer les statistiques sur la DataBrew console ou à l'aide de l' DataBrewAPI ou AWS des SDK.
-
Configurations au niveau des colonnes : à l'aide des paramètres de configuration de profil par défaut, vous pouvez sélectionner les colonnes à inclure dans votre tâche de profil. Utilisez Ajouter un remplacement de configuration pour sélectionner les colonnes pour lesquelles vous souhaitez limiter le nombre de statistiques collectées ou remplacer la configuration par défaut de certaines statistiques. Pour plus de détails sur les statistiques que vous pouvez configurer au niveau des colonnes, consultezStatistiques configurables au niveau des colonnes. Vous pouvez configurer les statistiques sur la DataBrew console ou à l'aide de l' DataBrew API ou AWS des SDK.
Assurez-vous que les remplacements de configuration que vous spécifiez s'appliquent aux colonnes que vous avez incluses dans votre profil de travail. En cas de conflit entre les différents remplacements que vous avez configurés pour une colonne, le dernier remplacement conflictuel est prioritaire.
-
(Facultatif) Vous pouvez créer des règles de qualité des données et appliquer des ensembles de règles supplémentaires associés à cet ensemble de données ou supprimer des règles déjà appliquées. Pour plus d'informations sur la validation de la qualité des données, voirValidation de la qualité des données dans AWS Glue DataBrew.
-
Dans le volet Paramètres avancés des tâches, vous pouvez choisir d'autres options concernant le mode d'exécution de votre tâche :
-
Nombre maximum d'unités : DataBrew traite les tâches à l'aide de plusieurs nœuds de calcul et s'exécute en parallèle. Le nombre de nœuds par défaut est de 5. Le nombre maximum de nœuds est de 149.
-
Délai d'expiration d'une tâche : si une tâche prend plus de minutes que le nombre de minutes que vous avez défini ici pour s'exécuter, elle échoue avec une erreur de temporisation. La valeur par défaut est de 2 880 minutes, soit 48 heures.
-
Nombre de tentatives : si une tâche échoue en cours d'exécution, DataBrew vous pouvez essayer de l'exécuter à nouveau. Par défaut, la tâche n'est pas réessayée.
-
Activer Amazon CloudWatch Logs pour le travail : permet DataBrew de publier des informations de diagnostic dans CloudWatch Logs. Ces journaux peuvent être utiles à des fins de résolution des problèmes ou pour obtenir plus de détails sur le traitement de la tâche.
-
-
Pour Associated Schedule, vous pouvez appliquer un calendrier de DataBrew travail afin que votre travail soit exécuté à un moment précis ou de manière récurrente. Pour de plus amples informations, veuillez consulter Automatiser l'exécution des tâches selon un calendrier.
-
Lorsque les paramètres sont tels que vous le souhaitez, choisissez Create job. Ou, si vous souhaitez exécuter le travail immédiatement, choisissez Create and run job.