View a markdown version of this page

Création d'une configuration de tâche de profil par programmation dans AWS Glue DataBrew - AWS Glue DataBrew Guide du développeur

Les traductions sont fournies par des outils de traduction automatique. En cas de conflit entre le contenu d'une traduction et celui de la version originale en anglais, la version anglaise prévaudra.

Création d'une configuration de tâche de profil par programmation dans AWS Glue DataBrew

Dans cette section, vous trouverez des descriptions des étapes et des fonctions des tâches de profilage que vous pouvez utiliser par programmation. Vous pouvez les utiliser soit à partir du AWS Command Line Interface(AWS CLI), soit à l'aide de l'un des AWS SDK.

Dans une tâche de profilage, vous pouvez personnaliser une configuration pour contrôler le mode d' DataBrew évaluation de votre ensemble de données. Vous pouvez appliquer la configuration à un ensemble de données ou à des colonnes spécifiques. Vous pouvez créer la configuration lors de la création d'une tâche de profil, puis la mettre à jour à tout moment.

Une structure de configuration de profil comprend quatre parties :

Voici un exemple.

{ "ProfileColumns": [ { "Name": "example" }, { "Regex": "example.*" } ], "DatasetStatisticsConfiguration": { "IncludedStatistics": [ "CORRELATION" ], "Overrides": [ { "Statistic": "CORRELATION", "Parameters": { "columnSelectors": "[{\"name\":\"example\"}, {\"regex\":\"example.*\"}]" } } ] }, "ColumnStatisticsConfigurations": [ { "Selectors": [ { "Name": "example" } ], "Statistics": { "IncludedStatistics": [ "CORRELATION", "DUPLICATE_ROWS_COUNT" ], "Overrides": [ { "Statistic": "VALUE_DISTRIBUTION", "Parameters": { "binNumber": "10" } } ] } } ] }

ProfileColumns section

Dans la ProfileColumns section de votre structure, définissez les colonnes de votre jeu de données que vous souhaitez évaluer dans votre profil de travail. ProfileColumnsest une liste de sélecteurs de colonnes (Selectors). Vous pouvez spécifier un nom de colonne ou une expression régulière dans un sélecteur de colonne. Un exemple suit.

"ProfileColumns": [{"Name": "example"}, {"Regex": "example.*"}]

Lorsque cette ProfileColumns option est spécifiée, seules les colonnes dont le nom correspond à un nom ou à une expression régulière ProfileColumns sont incluses dans la tâche de profilage. Si le travail de profil ne prend pas en charge le type de données d'une colonne sélectionnée, DataBrew ignore la colonne sélectionnée pendant l'exécution du travail.

S'il ProfileColumns n'est pas défini, la tâche de profilage évalue toutes les colonnes prises en charge. Les colonnes prises en charge sont des colonnes contenant des données d'un type de données pris en charge : ByteType ShortType IntegerTypeLongType,FloatType,DoubleType,String,, ouBoolean.

DatasetStatisticsConfiguration section

Dans la DatasetStatisticsConfiguration section de votre structure, vous pouvez créer une configuration pour les évaluations intercolonnes. La configuration inclut IncludedStatistics etOverrides. Un exemple suit.

"DatasetStatisticsConfiguration": { "IncludedStatistics": ["CORRELATION"], "Overrides": [ { "Statistic": "CORRELATION", "Parameters": { "columnSelectors": "[{\"name\":\"example\"}, {\"regex\":\"example.*\"}]" } } ] }

Vous pouvez sélectionner les évaluations que vous souhaitez avoir en y ajoutant des noms d'évaluationIncludedStatistics. Un exemple suit.

"IncludedStatistics": ["CORRELATION", "DUPLICATE_ROWS_COUNT"]

Lorsque vous le spécifiezIncludedStatistics, seules les évaluations de la liste sont incluses dans le profil du poste. S'il IncludedStatistics n'est pas défini, le job de profilage exécute toutes les évaluations prises en charge avec les paramètres par défaut. Vous pouvez exclure toutes les évaluations en ajoutant AUCUNE àIncludedStatistics. Un exemple suit.

"IncludedStatistics": ["NONE"]

Statistiques configurables au niveau du jeu de données

Dans la DatasetStatisticsConfiguration section de votre structure, un poste de profil soutient les évaluations indiquées dans le tableau suivant.

Nom de la statistique Description Types de données pris en charge État par défaut Attributs du résultat du profil Type de résultat de profil

NOMBRE DE LIGNES DUPLIQUÉES

Nombre de lignes dupliquées dans le jeu de données

tout

Enable

dupliquer RowsCount

Int

CORRÉLATION

Coefficient de corrélation de Pearson entre deux colonnes

number

Enable

corrélations (dans chaque colonne sélectionnée)

Objet

DansIncludedStatistics, vous pouvez remplacer les paramètres par défaut de chaque évaluation en ajoutant une dérogation. Chaque dérogation inclut le nom d'une évaluation particulière et une carte de paramètres.

DansDatasetStatisticsConfiguration, une tâche de profil prend en charge la CORRELATION dérogation. Cette dérogation calcule le coefficient de corrélation de Pearson entre deux colonnes à partir d'une liste de colonnes sélectionnées. Le paramètre par défaut consiste à sélectionner les 10 premières colonnes numériques. Vous pouvez spécifier un certain nombre de colonnes ou une liste de sélecteurs de colonnes pour remplacer le paramètre par défaut.

CORRELATIONprend les paramètres suivants :

  • columnNumber— Le nombre de colonnes numériques. La tâche de profilage sélectionne les n premières colonnes de l'ensemble de données. Cette valeur doit être supérieure à 1. Permet "ALL" de sélectionner toutes les colonnes numériques.

  • columnSelectors:— Liste des sélecteurs de colonnes. Chaque sélecteur peut avoir un nom de colonne ou une expression régulière.

Un exemple suit.

{ "Statistic": "CORRELATION", "Parameters": { "columnSelectors": "[{\"name\":\"example\"}, {\"regex\":\"example.*\"}]" } }

ColumnStatisticsConfigurations section

Dans la ColumnStatisticsConfigurations section de votre structure, vous pouvez créer des configurations pour des colonnes spécifiques. ColumnStatisticsConfigurationsest une liste de ColumnStatisticsConfiguration paramètres. Il y Selectors a une liste de sélecteurs de colonnes, et Statistics pour la configuration des statistiques. ColumnStatisticsConfiguration Un exemple suit.

{ "Selectors": [{"Name": "example"} ], "Statistics": { "IncludedStatistics": ["CORRELATION", "DUPLICATE_ROWS_COUNT"] "Overrides": [ { "Statistic": "VALUE_DISTRIBUTION", "Parameters": { "binNumber": "10" } } ] } }

Selectorsest une liste de sélecteurs de colonnes. De mêmeProfileColumns, vous pouvez spécifier un nom de colonne ou une expression régulière dans chaque sélecteur de colonne. Lorsque vous le spécifiezSelectors, la configuration des colonnes est appliquée aux colonnes qui correspondent à n'importe quel sélecteur de colonne dansSelectors. Dans le cas contraire, la configuration est appliquée à toutes les colonnes prises en charge.

DansStatistics, vous pouvez remplacer les paramètres des colonnes sélectionnées. Comme avecDatasetStatisticsConfiguration, Statistics a IncludedStatistics etOverrides.

Pour sélectionner les évaluations que vous souhaitez, ajoutez des noms d'évaluation àIncludedStatistics.

"IncludedStatistics": ["CORRELATION", "DUPLICATE_ROWS_COUNT"]

Lorsque vous le spécifiezIncludedStatistics, seules les évaluations de la liste sont incluses dans le profil du poste. Dans le cas contraire, la tâche de profilage exécute toutes les évaluations prises en charge avec les paramètres par défaut.

Vous pouvez exclure toutes les évaluations en ajoutant NONE àIncludedStatistics.

"IncludedStatistics": ["NONE"]

Dans certains cas, il peut y avoir plusieurs configurations différentes IncludedStatistics que vous pouvez appliquer à la même colonne. ColumnStatisticsConfigurations Dans ces cas, la tâche de profilage sélectionne la dernière configuration ColumnStatisticsConfigurations et l'applique IncludedStatistics à la colonne sélectionnée. Une nouvelle configuration remplace les anciennes.

Statistiques configurables au niveau des colonnes

EnColumnStatisticsConfigurations, un poste profilé soutient les évaluations présentées dans le tableau suivant.

Un type de données pris en charge number dans ce tableau signifie que le type de données de l'attribut est l'un des suivants : ByteTypeShortType,IntegerType,LongType,FloatType, ouDoubleType.

Nom de la statistique Description Types de données pris en charge État par défaut Attributs du résultat du profil Type de résultat de profil

Nom de la colonne.

tout

name

chaîne

Type de données de la colonne.

tout

type

chaîne

NOMBRE_VALEUR_DISTINCT

Nombre de valeurs distinctes. Une valeur distincte est une valeur qui apparaît au moins une fois.

number/boolean/chaîne

Activé

distinct ValuesCount

Int

ENTROPIE

Entropie (théorie de l'information).

number/boolean/chaîne

Activé

entropie

Double

PLAGE INTERQUARTILE

Variez entre 25 % et 75 % des chiffres.

number

Activé

Intervalle interquartile

Double

KURTOSIS

Kurtosis de la colonne.

number

Activé

kurtosis

Double

MAX

Valeur maximale dans la colonne.

number/string longueur

Activé

max

Int/Double

VALEUR_MAXIMALES

Liste des valeurs maximales de la colonne et de leur nombre.

number

Activé

Valeurs maximales

List

MEAN

Valeur moyenne des valeurs de la colonne.

number/string longueur

Activé

mean

Double

MEDIAN

Médiane des valeurs de la colonne.

number/string longueur

Activé

median

Double

DÉVIATION ABSOLUE MÉDIANE

La médiane des différences absolues entre chaque point de données et la médiane d'une colonne numérique.

number

Activé

médiane AbsoluteDeviation

Double

MIN

Valeur minimale dans la colonne.

number/string longueur

Activé

min

Int/Double

VALEUR_MINIMALES

Liste des valeurs minimales de la colonne et de leur nombre.

number

Activé

Valeurs minimales

List

COMPTE_VALEUR_MANQUANTES

Nombre de valeurs manquantes dans la colonne. Les chaînes nulles et vides sont considérées comme manquantes.

tout

Activé

manquant ValuesCount

Int

MODE

La valeur la plus fréquente dans la colonne. Si plusieurs valeurs apparaissent aussi souvent, le mode est l'une de ces valeurs.

number/string longueur

Activé

mode

Int/Double

VALEUR_LES PLUS COMMUNES

Liste des valeurs les plus courantes de la colonne.

number/boolean/chaîne

Activé

le plus CommonValues

List

DÉTECTION DES VALEURS ABERRANTES

Détectez les valeurs aberrantes dans la colonne à l'aide de l'algorithme Z_score. Comptez le nombre de valeurs aberrantes et extrayez une liste d'échantillons à partir des valeurs aberrantes détectées.

number/string longueur

Activé

zScoreOutliersCount, z ScoreOutliersSample

Int/List

PERCENTILES

Valeurs percentiles de la colonne numérique (5 %, 25 %, 75 %, 95 %).

number

Activé

percentile 5, percentile 25, percentile 75, percentile 95

Double

RANGE

Plage de valeurs dans la colonne.

number

Activé

range

Int/Double

ASYMÉTRIE

Asymétrie des valeurs dans la colonne.

number

Activé

asymétrie

Double

ÉCART-TYPE

Écart type d'échantillon non biaisé des valeurs de la colonne.

number/string longueur

Activé

Écart type

Double

SUM

Somme des valeurs de la colonne.

number

Activé

sum

Int/Double

DÉNOMBRE_VALEUR_UNIQUE

Nombre de valeurs uniques. Une valeur unique signifie qu'elle n'apparaît qu'une seule fois.

number/boolean/chaîne

Activé

unique ValuesCount

Int

DISTRIBUTION_VALEUR

Mesure de la distribution des valeurs dans la colonne par plage.

number/string longueur

Activé

Répartition de la valeur

List

ÉCART

Variance des valeurs de la colonne.

number

Activé

variance

Double

Z_SCORE_DISTRIBUTION

Mesure de la distribution des valeurs du score Z des points de données par plage.

number

Activé

z ScoreDistribution

List

NOMBRE DE ZÉROS

Nombre de zéros (0) dans la colonne.

number

Activé

Nombre de zéros

Int

DansIncludedStatistics, vous pouvez remplacer les paramètres par défaut de chaque évaluation en ajoutant une dérogation. Chaque dérogation inclut le nom d'une évaluation particulière et une carte de paramètres.

Paramètres des ColumnStatisticsConfigurations colonnes

DansColumnStatisticsConfigurations, une tâche de profilage prend en charge les paramètres suivants.

Dans certains cas, il peut y avoir plusieurs configurations différentes IncludedStatistics que vous pouvez appliquer à la même colonne. ColumnStatisticsConfigurations Dans ces cas, la tâche de profilage sélectionne la dernière configuration ColumnStatisticsConfigurations et l'applique IncludedStatistics à la colonne sélectionnée. Une nouvelle configuration remplace les anciennes.

VALEUR_MAXIMALES

Répertorie les valeurs maximales de la colonne numérique et leur nombre. La taille de liste par défaut est 5. Vous pouvez modifier la taille de la liste en spécifiant une valeur poursampleSize.

Paramètres

sampleSize— La taille de la liste qui inclut le nombre et le nombre maximum de valeurs dans la colonne numérique. Cette valeur doit être supérieure à 0. Permet "ALL" de répertorier toutes les valeurs.

Exemple

{ "Statistic": "MAXIMUM_VALUES", "Parameters": { "sampleSize": "5" } }

VALEUR_MINIMALES

Répertorie les valeurs minimales de la colonne numérique et leur nombre. La taille de liste par défaut est 5. Vous pouvez modifier la taille de la liste en spécifiant une valeur poursampleSize.

Paramètres

sampleSize— La taille de la liste qui inclut le nombre et le nombre maximum de valeurs dans la colonne numérique. Cette valeur doit être supérieure à 0. Permet "ALL" de répertorier toutes les valeurs.

Exemple

{ "Statistic": "MINIMUM_VALUES", "Parameters": { "sampleSize": "5" } }

VALEUR_LES PLUS COMMUNES

Répertorie les valeurs les plus courantes de la colonne et leur nombre. La taille de liste par défaut est 50. Vous pouvez modifier la taille de la liste en spécifiant une valeur poursampleSize.

Paramètres

sampleSize— La taille de la liste qui inclut le nombre et le nombre maximum de valeurs dans la colonne numérique. Cette valeur doit être supérieure à 0. Permet "ALL" de répertorier toutes les valeurs.

Exemple

{ "Statistic": "MOST_COMMON_VALUES", "Parameters": { "sampleSize": "50" } }

DÉTECTION DES VALEURS ABERRANTES

Détecte les valeurs aberrantes dans la colonne numérique ou la colonne de chaîne (en fonction de la longueur de la chaîne) par l'algorithme Z_score.

Votre job de profil compte le nombre de valeurs aberrantes et génère une liste d'échantillons de valeurs aberrantes et de leurs scores Z. La liste d'échantillons est ordonnée en fonction de la valeur absolue du score Z. La taille de liste par défaut est 50.

L'algorithme Z_Score identifie une valeur comme une valeur aberrante lorsqu'elle s'écarte de la moyenne d'un écart supérieur au seuil d'écart type. Le seuil de valeur aberrante par défaut est 3.

Vous pouvez fournir un seuil supplémentaire, un seuil modéré, pour obtenir plus d'informations. Votre seuil modéré doit être inférieur à votre seuil. Cette fonctionnalité est désactivée par défaut. Lorsqu'un seuil modéré est spécifié, votre profil d'emploi renvoie un compte de plus,zScoreMildOutliersCount. zScoreOutliersSamplePeut également inclure un échantillon de seuils légèrement aberrants dans ce cas.

Paramètres

  • threshold— La valeur seuil à utiliser lors de la détection des valeurs aberrantes. Cette valeur doit être supérieure ou égale à 0.

  • mildThreshold— La valeur seuil modérée à utiliser lors de la détection des valeurs aberrantes. Cette valeur doit être supérieure ou égale à 0 et inférieure àthreshold.

  • sampleSize— Taille de la liste qui inclut les valeurs aberrantes dans la colonne. Permet "ALL" de répertorier toutes les valeurs.

Exemple

{ "Statistic": "OUTLIER_DETECTION", "Parameters": { "threshold": "5", "mildThreshold": "3.5", "sampleSize": "20" } }

DISTRIBUTION_VALEUR

Mesure la distribution des valeurs dans la colonne en fonction des plages de valeurs. Une tâche de profilage regroupe les valeurs d'une colonne numérique ou d'une colonne de chaîne (en fonction de la longueur de la chaîne) dans des groupes par plages numériques et génère une liste de groupes. Les compartiments sont consécutifs, et la limite supérieure d'un compartiment est la limite inférieure du compartiment suivant.

Paramètres

binNumber— Nombre de bacs. Cette valeur doit être supérieure à 0.

Exemple

{ "Statistic": "VALUE_DISTRIBUTION", "Parameters": { "binNumber": "5" } }

Z_SCORE_DISTRIBUTION

Mesure la distribution des scores Z des valeurs dans une colonne numérique. Une tâche de profilage regroupe les scores Z de valeurs dans des groupes par plages numériques et génère une liste de groupes. Les compartiments sont consécutifs, et la limite supérieure d'un compartiment est la limite inférieure du compartiment suivant.

Paramètres

binNumber— Nombre de bacs. Cette valeur doit être supérieure à 0.

Exemple

{ "Statistic": "Z_SCORE_DISTRIBUTION", "Parameters": { "binNumber": "5" } }

EntityDetectorConfiguration section pour configurer les informations personnelles

Dans la EntityDetectorConfiguration section de votre structure, vous pouvez configurer les types d'entités de votre ensemble de données que vous DataBrew souhaitez détecter en tant qu'informations personnelles identifiables (PII) pour un poste de profil.

EntityTypes

Vous configurez les types d'entités que vous DataBrew souhaitez détecter en tant que PII pour votre tâche de profil. Lorsqu'elle EntityDetectorConfiguration n'est pas définie, la détection des entités est désactivée. Les types d'entités suivants peuvent être détectés dans votre ensemble de données :

  • USA_SSN

  • EMAIL

  • USA_ITIN

  • USA_PASSPORT_NUMBER

  • PHONE_NUMBER

  • USA_DRIVING_LICENSE

  • BANK_ACCOUNT

  • CREDIT_CARD

  • IP_ADDRESS

  • MAC_ADDRESS

  • USA_DEA_NUMBER

  • USA_HCPCS_CODE

  • USA_NATIONAL_PROVIDER_IDENTIFIER

  • USA_NATIONAL_DRUG_CODE

  • USA_HEALTH_INSURANCE_CLAIM_NUMBER

  • USA_MEDICARE_BENEFICIARY_IDENTIFIER

  • USA_CPT_CODE

  • PERSON_NAME

  • DATE

Le groupe de types d'entités USA_ALL est également pris en charge et inclut tous les types d'entités ci-dessus, à l'exception de PERSON_NAME etDATE.

Le type de EntityTypes est un tableau de chaînes.

AllowedStatistics

Configurez les statistiques autorisées à être exécutées sur les colonnes contenant les entités détectées. S'il n'AllowedStatisticsest pas défini, aucune statistique ne sera calculée sur les colonnes contenant les entités détectées. Consultez Statistiques configurables au niveau des colonnes la liste des valeurs valides pour le AllowedStatistics paramètre.

Le type de AllowedStatistics est un tableau d'AllowedStatisticsobjets.