翻訳は機械翻訳により提供されています。提供された翻訳内容と英語版の間で齟齬、不一致または矛盾がある場合、英語版が優先します。
個人を特定できる情報 (PII) の特定と処理
分析関数または機械学習モデルを構築する場合、個人を特定できる情報 (PII) データが公開されないようにするための保護が必要です。PII は、住所、銀行口座番号、電話番号など、個人を特定するために使用できる個人データです。たとえば、データアナリストやデータサイエンティストがデータセットを使用して一般的な人口統計情報を検出する場合、特定の個人の PII にアクセスすることはできません。
DataBrew は、データ準備プロセス中に PII データを難読化するデータマスキングメカニズムを提供します。組織のニーズに応じて、さまざまな PII データ秘匿化メカニズムを使用できます。PII データを難読化して、ユーザーが元に戻せないようにしたり、難読化を元に戻したりすることができます。
DataBrew で PII データを特定してマスキングするには、顧客が PII データの編集に使用できる一連の変換を構築する必要があります。このプロセスの一環として、DataBrew コンソールのデータプロファイルの概要ダッシュボードに PII データ検出と統計情報を提供します。
次のデータマスキング手法を使用できます。
置換 – PII データを他の真正な値に置き換えます。
シャッフル — 同じ列の値を異なる行にシャッフルします。
確定的暗号化 – 確定的暗号化アルゴリズムを列値に適用します。確定的暗号化では、値に対して常に同じ暗号文が生成されます。
確率的暗号化 – 確率的暗号化アルゴリズムを列値に適用します。確率的暗号化は、適用されるたびに異なる暗号文が生成されます。
復号 — 暗号化キーに基づいて列を復号します。
Nulling out or delete – 特定のフィールドを null 値に置き換えるか、列を削除します。
マスキング — 文字スクランブルを使用するか、列内の特定の部分をマスクします。
ハッシュ — ハッシュ関数を列値に適用します。
変換の使用の詳細については、「個人を特定できる情報 (PII) レシピの手順」を参照してください。検出可能なエンティティタイプのリストなど、プロファイルジョブを使用して PII を検出する方法の詳細については、「プロファイルジョブ設定をプログラムで構築する」の「PII を設定するための EntityDetectorConfiguration」セクションを参照してください。