Les traductions sont fournies par des outils de traduction automatique. En cas de conflit entre le contenu d'une traduction et celui de la version originale en anglais, la version anglaise prévaudra.
Création d'une configuration de tâche de profil par programmation dans AWS Glue DataBrew
Dans cette section, vous trouverez des descriptions des étapes et des fonctions des tâches de profilage que vous pouvez utiliser par programmation. Vous pouvez les utiliser soit à partir du AWS Command Line Interface(AWS CLI), soit à l'aide de l'un des AWS SDK.
Dans une tâche de profilage, vous pouvez personnaliser une configuration pour contrôler le mode d' DataBrew évaluation de votre ensemble de données. Vous pouvez appliquer la configuration à un ensemble de données ou à des colonnes spécifiques. Vous pouvez créer la configuration lors de la création d'une tâche de profil, puis la mettre à jour à tout moment.
Une structure de configuration de profil comprend quatre parties :
Voici un exemple.
{ "ProfileColumns": [ { "Name": "example" }, { "Regex": "example.*" } ], "DatasetStatisticsConfiguration": { "IncludedStatistics": [ "CORRELATION" ], "Overrides": [ { "Statistic": "CORRELATION", "Parameters": { "columnSelectors": "[{\"name\":\"example\"}, {\"regex\":\"example.*\"}]" } } ] }, "ColumnStatisticsConfigurations": [ { "Selectors": [ { "Name": "example" } ], "Statistics": { "IncludedStatistics": [ "CORRELATION", "DUPLICATE_ROWS_COUNT" ], "Overrides": [ { "Statistic": "VALUE_DISTRIBUTION", "Parameters": { "binNumber": "10" } } ] } } ] }
ProfileColumns section
Dans la ProfileColumns section de votre structure, définissez les colonnes de votre jeu de données que vous souhaitez évaluer dans votre profil de travail. ProfileColumnsest une liste de sélecteurs de colonnes (Selectors). Vous pouvez spécifier un nom de colonne ou une expression régulière dans un sélecteur de colonne. Un exemple suit.
"ProfileColumns": [{"Name": "example"}, {"Regex": "example.*"}]
Lorsque cette ProfileColumns option est spécifiée, seules les colonnes dont le nom correspond à un nom ou à une expression régulière ProfileColumns sont incluses dans la tâche de profilage. Si le travail de profil ne prend pas en charge le type de données d'une colonne sélectionnée, DataBrew ignore la colonne sélectionnée pendant l'exécution du travail.
S'il ProfileColumns n'est pas défini, la tâche de profilage évalue toutes les colonnes prises en charge. Les colonnes prises en charge sont des colonnes contenant des données d'un type de données pris en charge : ByteType ShortType IntegerTypeLongType,FloatType,DoubleType,String,, ouBoolean.
DatasetStatisticsConfiguration section
Dans la DatasetStatisticsConfiguration section de votre structure, vous pouvez créer une configuration pour les évaluations intercolonnes. La configuration inclut IncludedStatistics etOverrides. Un exemple suit.
"DatasetStatisticsConfiguration": { "IncludedStatistics": ["CORRELATION"], "Overrides": [ { "Statistic": "CORRELATION", "Parameters": { "columnSelectors": "[{\"name\":\"example\"}, {\"regex\":\"example.*\"}]" } } ] }
Vous pouvez sélectionner les évaluations que vous souhaitez avoir en y ajoutant des noms d'évaluationIncludedStatistics. Un exemple suit.
"IncludedStatistics": ["CORRELATION", "DUPLICATE_ROWS_COUNT"]
Lorsque vous le spécifiezIncludedStatistics, seules les évaluations de la liste sont incluses dans le profil du poste. S'il IncludedStatistics n'est pas défini, le job de profilage exécute toutes les évaluations prises en charge avec les paramètres par défaut. Vous pouvez exclure toutes les évaluations en ajoutant AUCUNE àIncludedStatistics. Un exemple suit.
"IncludedStatistics": ["NONE"]
Statistiques configurables au niveau du jeu de données
Dans la DatasetStatisticsConfiguration section de votre structure, un poste de profil soutient les évaluations indiquées dans le tableau suivant.
| Nom de la statistique | Description | Types de données pris en charge | État par défaut | Attributs du résultat du profil | Type de résultat de profil |
|---|---|---|---|---|---|
NOMBRE DE LIGNES DUPLIQUÉES |
Nombre de lignes dupliquées dans le jeu de données |
tout |
Enable |
dupliquer RowsCount |
Int |
CORRÉLATION |
Coefficient de corrélation de Pearson entre deux colonnes |
number |
Enable |
corrélations (dans chaque colonne sélectionnée) |
Objet |
DansIncludedStatistics, vous pouvez remplacer les paramètres par défaut de chaque évaluation en ajoutant une dérogation. Chaque dérogation inclut le nom d'une évaluation particulière et une carte de paramètres.
DansDatasetStatisticsConfiguration, une tâche de profil prend en charge la CORRELATION dérogation. Cette dérogation calcule le coefficient de corrélation de Pearson entre deux colonnes à partir d'une liste de colonnes sélectionnées. Le paramètre par défaut consiste à sélectionner les 10 premières colonnes numériques. Vous pouvez spécifier un certain nombre de colonnes ou une liste de sélecteurs de colonnes pour remplacer le paramètre par défaut.
CORRELATIONprend les paramètres suivants :
columnNumber— Le nombre de colonnes numériques. La tâche de profilage sélectionne les n premières colonnes de l'ensemble de données. Cette valeur doit être supérieure à 1. Permet"ALL"de sélectionner toutes les colonnes numériques.columnSelectors:— Liste des sélecteurs de colonnes. Chaque sélecteur peut avoir un nom de colonne ou une expression régulière.
Un exemple suit.
{ "Statistic": "CORRELATION", "Parameters": { "columnSelectors": "[{\"name\":\"example\"}, {\"regex\":\"example.*\"}]" } }
ColumnStatisticsConfigurations section
Dans la ColumnStatisticsConfigurations section de votre structure, vous pouvez créer des configurations pour des colonnes spécifiques. ColumnStatisticsConfigurationsest une liste de ColumnStatisticsConfiguration paramètres. Il y Selectors a une liste de sélecteurs de colonnes, et Statistics pour la configuration des statistiques. ColumnStatisticsConfiguration Un exemple suit.
{ "Selectors": [{"Name": "example"} ], "Statistics": { "IncludedStatistics": ["CORRELATION", "DUPLICATE_ROWS_COUNT"] "Overrides": [ { "Statistic": "VALUE_DISTRIBUTION", "Parameters": { "binNumber": "10" } } ] } }
Selectorsest une liste de sélecteurs de colonnes. De mêmeProfileColumns, vous pouvez spécifier un nom de colonne ou une expression régulière dans chaque sélecteur de colonne. Lorsque vous le spécifiezSelectors, la configuration des colonnes est appliquée aux colonnes qui correspondent à n'importe quel sélecteur de colonne dansSelectors. Dans le cas contraire, la configuration est appliquée à toutes les colonnes prises en charge.
DansStatistics, vous pouvez remplacer les paramètres des colonnes sélectionnées. Comme avecDatasetStatisticsConfiguration, Statistics a IncludedStatistics etOverrides.
Pour sélectionner les évaluations que vous souhaitez, ajoutez des noms d'évaluation àIncludedStatistics.
"IncludedStatistics": ["CORRELATION", "DUPLICATE_ROWS_COUNT"]
Lorsque vous le spécifiezIncludedStatistics, seules les évaluations de la liste sont incluses dans le profil du poste. Dans le cas contraire, la tâche de profilage exécute toutes les évaluations prises en charge avec les paramètres par défaut.
Vous pouvez exclure toutes les évaluations en ajoutant NONE àIncludedStatistics.
"IncludedStatistics": ["NONE"]
Dans certains cas, il peut y avoir plusieurs configurations différentes IncludedStatistics que vous pouvez appliquer à la même colonne. ColumnStatisticsConfigurations Dans ces cas, la tâche de profilage sélectionne la dernière configuration ColumnStatisticsConfigurations et l'applique IncludedStatistics à la colonne sélectionnée. Une nouvelle configuration remplace les anciennes.
Statistiques configurables au niveau des colonnes
EnColumnStatisticsConfigurations, un poste profilé soutient les évaluations présentées dans le tableau suivant.
Un type de données pris en charge number dans ce tableau signifie que le type de données de l'attribut est l'un des suivants : ByteTypeShortType,IntegerType,LongType,FloatType, ouDoubleType.
| Nom de la statistique | Description | Types de données pris en charge | État par défaut | Attributs du résultat du profil | Type de résultat de profil |
|---|---|---|---|---|---|
– |
Nom de la colonne. |
tout |
– |
name |
chaîne |
– |
Type de données de la colonne. |
tout |
– |
type |
chaîne |
NOMBRE_VALEUR_DISTINCT |
Nombre de valeurs distinctes. Une valeur distincte est une valeur qui apparaît au moins une fois. |
number/boolean/chaîne |
Activé |
distinct ValuesCount |
Int |
ENTROPIE |
Entropie (théorie de l'information). |
number/boolean/chaîne |
Activé |
entropie |
Double |
PLAGE INTERQUARTILE |
Variez entre 25 % et 75 % des chiffres. |
number |
Activé |
Intervalle interquartile |
Double |
KURTOSIS |
Kurtosis de la colonne. |
number |
Activé |
kurtosis |
Double |
MAX |
Valeur maximale dans la colonne. |
number/string longueur |
Activé |
max |
Int/Double |
VALEUR_MAXIMALES |
Liste des valeurs maximales de la colonne et de leur nombre. |
number |
Activé |
Valeurs maximales |
List |
MEAN |
Valeur moyenne des valeurs de la colonne. |
number/string longueur |
Activé |
mean |
Double |
MEDIAN |
Médiane des valeurs de la colonne. |
number/string longueur |
Activé |
median |
Double |
DÉVIATION ABSOLUE MÉDIANE |
La médiane des différences absolues entre chaque point de données et la médiane d'une colonne numérique. |
number |
Activé |
médiane AbsoluteDeviation |
Double |
MIN |
Valeur minimale dans la colonne. |
number/string longueur |
Activé |
min |
Int/Double |
VALEUR_MINIMALES |
Liste des valeurs minimales de la colonne et de leur nombre. |
number |
Activé |
Valeurs minimales |
List |
COMPTE_VALEUR_MANQUANTES |
Nombre de valeurs manquantes dans la colonne. Les chaînes nulles et vides sont considérées comme manquantes. |
tout |
Activé |
manquant ValuesCount |
Int |
MODE |
La valeur la plus fréquente dans la colonne. Si plusieurs valeurs apparaissent aussi souvent, le mode est l'une de ces valeurs. |
number/string longueur |
Activé |
mode |
Int/Double |
VALEUR_LES PLUS COMMUNES |
Liste des valeurs les plus courantes de la colonne. |
number/boolean/chaîne |
Activé |
le plus CommonValues |
List |
DÉTECTION DES VALEURS ABERRANTES |
Détectez les valeurs aberrantes dans la colonne à l'aide de l'algorithme Z_score. Comptez le nombre de valeurs aberrantes et extrayez une liste d'échantillons à partir des valeurs aberrantes détectées. |
number/string longueur |
Activé |
zScoreOutliersCount, z ScoreOutliersSample |
Int/List |
PERCENTILES |
Valeurs percentiles de la colonne numérique (5 %, 25 %, 75 %, 95 %). |
number |
Activé |
percentile 5, percentile 25, percentile 75, percentile 95 |
Double |
RANGE |
Plage de valeurs dans la colonne. |
number |
Activé |
range |
Int/Double |
ASYMÉTRIE |
Asymétrie des valeurs dans la colonne. |
number |
Activé |
asymétrie |
Double |
ÉCART-TYPE |
Écart type d'échantillon non biaisé des valeurs de la colonne. |
number/string longueur |
Activé |
Écart type |
Double |
SUM |
Somme des valeurs de la colonne. |
number |
Activé |
sum |
Int/Double |
DÉNOMBRE_VALEUR_UNIQUE |
Nombre de valeurs uniques. Une valeur unique signifie qu'elle n'apparaît qu'une seule fois. |
number/boolean/chaîne |
Activé |
unique ValuesCount |
Int |
DISTRIBUTION_VALEUR |
Mesure de la distribution des valeurs dans la colonne par plage. |
number/string longueur |
Activé |
Répartition de la valeur |
List |
ÉCART |
Variance des valeurs de la colonne. |
number |
Activé |
variance |
Double |
Z_SCORE_DISTRIBUTION |
Mesure de la distribution des valeurs du score Z des points de données par plage. |
number |
Activé |
z ScoreDistribution |
List |
NOMBRE DE ZÉROS |
Nombre de zéros (0) dans la colonne. |
number |
Activé |
Nombre de zéros |
Int |
DansIncludedStatistics, vous pouvez remplacer les paramètres par défaut de chaque évaluation en ajoutant une dérogation. Chaque dérogation inclut le nom d'une évaluation particulière et une carte de paramètres.
Paramètres des ColumnStatisticsConfigurations colonnes
DansColumnStatisticsConfigurations, une tâche de profilage prend en charge les paramètres suivants.
Dans certains cas, il peut y avoir plusieurs configurations différentes IncludedStatistics que vous pouvez appliquer à la même colonne. ColumnStatisticsConfigurations Dans ces cas, la tâche de profilage sélectionne la dernière configuration ColumnStatisticsConfigurations et l'applique IncludedStatistics à la colonne sélectionnée. Une nouvelle configuration remplace les anciennes.
VALEUR_MAXIMALES
Répertorie les valeurs maximales de la colonne numérique et leur nombre. La taille de liste par défaut est 5. Vous pouvez modifier la taille de la liste en spécifiant une valeur poursampleSize.
Paramètres
sampleSize— La taille de la liste qui inclut le nombre et le nombre maximum de valeurs dans la colonne numérique. Cette valeur doit être supérieure à 0. Permet "ALL" de répertorier toutes les valeurs.
Exemple
{ "Statistic": "MAXIMUM_VALUES", "Parameters": { "sampleSize": "5" } }
VALEUR_MINIMALES
Répertorie les valeurs minimales de la colonne numérique et leur nombre. La taille de liste par défaut est 5. Vous pouvez modifier la taille de la liste en spécifiant une valeur poursampleSize.
Paramètres
sampleSize— La taille de la liste qui inclut le nombre et le nombre maximum de valeurs dans la colonne numérique. Cette valeur doit être supérieure à 0. Permet "ALL" de répertorier toutes les valeurs.
Exemple
{ "Statistic": "MINIMUM_VALUES", "Parameters": { "sampleSize": "5" } }
VALEUR_LES PLUS COMMUNES
Répertorie les valeurs les plus courantes de la colonne et leur nombre. La taille de liste par défaut est 50. Vous pouvez modifier la taille de la liste en spécifiant une valeur poursampleSize.
Paramètres
sampleSize— La taille de la liste qui inclut le nombre et le nombre maximum de valeurs dans la colonne numérique. Cette valeur doit être supérieure à 0. Permet "ALL" de répertorier toutes les valeurs.
Exemple
{ "Statistic": "MOST_COMMON_VALUES", "Parameters": { "sampleSize": "50" } }
DÉTECTION DES VALEURS ABERRANTES
Détecte les valeurs aberrantes dans la colonne numérique ou la colonne de chaîne (en fonction de la longueur de la chaîne) par l'algorithme Z_score.
Votre job de profil compte le nombre de valeurs aberrantes et génère une liste d'échantillons de valeurs aberrantes et de leurs scores Z. La liste d'échantillons est ordonnée en fonction de la valeur absolue du score Z. La taille de liste par défaut est 50.
L'algorithme Z_Score identifie une valeur comme une valeur aberrante lorsqu'elle s'écarte de la moyenne d'un écart supérieur au seuil d'écart type. Le seuil de valeur aberrante par défaut est 3.
Vous pouvez fournir un seuil supplémentaire, un seuil modéré, pour obtenir plus d'informations. Votre seuil modéré doit être inférieur à votre seuil. Cette fonctionnalité est désactivée par défaut. Lorsqu'un seuil modéré est spécifié, votre profil d'emploi renvoie un compte de plus,zScoreMildOutliersCount. zScoreOutliersSamplePeut également inclure un échantillon de seuils légèrement aberrants dans ce cas.
Paramètres
threshold— La valeur seuil à utiliser lors de la détection des valeurs aberrantes. Cette valeur doit être supérieure ou égale à 0.mildThreshold— La valeur seuil modérée à utiliser lors de la détection des valeurs aberrantes. Cette valeur doit être supérieure ou égale à 0 et inférieure àthreshold.sampleSize— Taille de la liste qui inclut les valeurs aberrantes dans la colonne. Permet"ALL"de répertorier toutes les valeurs.
Exemple
{ "Statistic": "OUTLIER_DETECTION", "Parameters": { "threshold": "5", "mildThreshold": "3.5", "sampleSize": "20" } }
DISTRIBUTION_VALEUR
Mesure la distribution des valeurs dans la colonne en fonction des plages de valeurs. Une tâche de profilage regroupe les valeurs d'une colonne numérique ou d'une colonne de chaîne (en fonction de la longueur de la chaîne) dans des groupes par plages numériques et génère une liste de groupes. Les compartiments sont consécutifs, et la limite supérieure d'un compartiment est la limite inférieure du compartiment suivant.
Paramètres
binNumber— Nombre de bacs. Cette valeur doit être supérieure à 0.
Exemple
{ "Statistic": "VALUE_DISTRIBUTION", "Parameters": { "binNumber": "5" } }
Z_SCORE_DISTRIBUTION
Mesure la distribution des scores Z des valeurs dans une colonne numérique. Une tâche de profilage regroupe les scores Z de valeurs dans des groupes par plages numériques et génère une liste de groupes. Les compartiments sont consécutifs, et la limite supérieure d'un compartiment est la limite inférieure du compartiment suivant.
Paramètres
binNumber— Nombre de bacs. Cette valeur doit être supérieure à 0.
Exemple
{ "Statistic": "Z_SCORE_DISTRIBUTION", "Parameters": { "binNumber": "5" } }
EntityDetectorConfiguration section pour configurer les informations personnelles
Dans la EntityDetectorConfiguration section de votre structure, vous pouvez configurer les types d'entités de votre ensemble de données que vous DataBrew souhaitez détecter en tant qu'informations personnelles identifiables (PII) pour un poste de profil.
EntityTypes
Vous configurez les types d'entités que vous DataBrew souhaitez détecter en tant que PII pour votre tâche de profil. Lorsqu'elle EntityDetectorConfiguration n'est pas définie, la détection des entités est désactivée. Les types d'entités suivants peuvent être détectés dans votre ensemble de données :
USA_SSN
EMAIL
USA_ITIN
USA_PASSPORT_NUMBER
PHONE_NUMBER
USA_DRIVING_LICENSE
BANK_ACCOUNT
CREDIT_CARD
IP_ADDRESS
MAC_ADDRESS
USA_DEA_NUMBER
USA_HCPCS_CODE
USA_NATIONAL_PROVIDER_IDENTIFIER
USA_NATIONAL_DRUG_CODE
USA_HEALTH_INSURANCE_CLAIM_NUMBER
USA_MEDICARE_BENEFICIARY_IDENTIFIER
USA_CPT_CODE
PERSON_NAME
DATE
Le groupe de types d'entités USA_ALL est également pris en charge et inclut tous les types d'entités ci-dessus, à l'exception de PERSON_NAME etDATE.
Le type de EntityTypes est un tableau de chaînes.
AllowedStatistics
Configurez les statistiques autorisées à être exécutées sur les colonnes contenant les entités détectées. S'il n'AllowedStatisticsest pas défini, aucune statistique ne sera calculée sur les colonnes contenant les entités détectées. Consultez Statistiques configurables au niveau des colonnes la liste des valeurs valides pour le AllowedStatistics paramètre.
Le type de AllowedStatistics est un tableau d'AllowedStatisticsobjets.