Les traductions sont fournies par des outils de traduction automatique. En cas de conflit entre le contenu d'une traduction et celui de la version originale en anglais, la version anglaise prévaudra.
Identification et traitement des informations personnelles identifiables (PII)
Lorsque vous créez des fonctions analytiques ou des modèles d'apprentissage automatique, vous avez besoin de mesures de protection pour empêcher l'exposition de données d'identification personnelle (PII). Les informations personnelles sont des données personnelles qui peuvent être utilisées pour identifier une personne, telles qu'une adresse, un numéro de compte bancaire ou un numéro de téléphone. Par exemple, lorsque les analystes de données et les scientifiques des données utilisent des ensembles de données pour découvrir des informations démographiques générales, ils ne devraient pas avoir accès aux informations personnelles de personnes spécifiques.
DataBrew fournit des mécanismes de masquage des données pour masquer les données PII pendant le processus de préparation des données. En fonction des besoins de votre organisation, différents mécanismes de rédaction des données personnelles sont disponibles. Vous pouvez masquer les données d'identification personnelle afin que les utilisateurs ne puissent pas les rétablir, ou vous pouvez rendre l'obfuscation réversible.
L'identification et le masquage des données PII DataBrew impliquent la création d'un ensemble de transformations que les clients peuvent utiliser pour supprimer les données PII. Une partie de ce processus consiste à fournir des statistiques et des fonctionnalités de détection des données personnelles dans le tableau de bord de présentation du profil de données de la DataBrew console.
Vous pouvez utiliser les techniques de masquage de données suivantes :
Substitution — Remplacez les données PII par d'autres valeurs d'apparence authentique.
Répartition — Répartissez la valeur d'une même colonne dans différentes lignes.
Chiffrement déterministe : appliquez des algorithmes de chiffrement déterministes aux valeurs des colonnes. Le chiffrement déterministe produit toujours le même texte chiffré pour une valeur.
Chiffrement probabiliste : appliquez des algorithmes de chiffrement probabiliste aux valeurs des colonnes. Le chiffrement probabiliste produit un texte chiffré différent chaque fois qu'il est appliqué.
Déchiffrement : déchiffrez les colonnes en fonction des clés de chiffrement.
Annulation ou suppression : remplacez un champ spécifique par une valeur nulle ou supprimez la colonne.
Masquage : utilisez le brouillage de caractères ou masquez certaines parties des colonnes.
Hachage — Appliquez des fonctions de hachage aux valeurs des colonnes.
Pour plus d'informations sur l'utilisation des transformations, voir Étapes de préparation des informations personnelles identifiables (PII). Pour plus d'informations sur l'utilisation des tâches de profil pour détecter les informations personnelles, y compris une liste des types d'entités pouvant être détectés, consultez la EntityDetectorConfiguration section consacrée à la configuration des tâches de profil dans Création d'une configuration de tâche de profil par programmation.