View a markdown version of this page

Identificação e tratamento de informações de identificação pessoal (PII) - AWS Glue DataBrew Guia do Desenvolvedor

As traduções são geradas por tradução automática. Em caso de conflito entre o conteúdo da tradução e da versão original em inglês, a versão em inglês prevalecerá.

Identificação e tratamento de informações de identificação pessoal (PII)

Ao criar funções analíticas ou modelos de aprendizado de máquina, você precisa de proteções para evitar a exposição de dados de informações de identificação pessoal (PII). PII são dados pessoais que podem ser usados para identificar um indivíduo, como endereço, número de conta bancária ou número de telefone. Por exemplo, quando analistas e cientistas de dados usam conjuntos de dados para descobrir informações demográficas gerais, eles não devem ter acesso às PII de indivíduos específicos.

DataBrew fornece mecanismos de mascaramento de dados para ofuscar dados de PII durante o processo de preparação de dados. Dependendo das necessidades da sua organização, existem diferentes mecanismos de redação de dados de PII disponíveis. Você pode ofuscar os dados de PII para que os usuários não possam revertê-los ou pode tornar a ofuscação reversível.

Identificar e mascarar dados de PII DataBrew envolve a criação de um conjunto de transformações que os clientes podem usar para redigir dados de PII. Parte desse processo é fornecer estatísticas e detecção de dados de PII no painel de visão geral do Perfil de Dados no DataBrew console.

Você pode usar as seguintes técnicas de mascaramento de dados:

  • Substituição — substitua os dados de PII por outros valores com aparência autêntica.

  • Embaralhamento — Embaralhe o valor da mesma coluna em linhas diferentes.

  • Criptografia determinística: aplique algoritmos de criptografia determinística aos valores da coluna. A criptografia determinística sempre produz o mesmo texto cifrado para um valor.

  • Criptografia probabilística: aplique algoritmos de criptografia probabilística aos valores da coluna. A criptografia probabilística produz texto cifrado diferente toda vez que é aplicada.

  • Descriptografia — Descriptografe colunas com base em chaves de criptografia.

  • Anulação ou exclusão — substitua um determinado campo por um valor nulo ou exclua a coluna.

  • Mascaramento — Use a codificação de caracteres ou mascare certas partes nas colunas.

  • Hash: aplique funções de hash aos valores da coluna.

Para obter mais informações sobre o uso de transformações, consulte as etapas da receita de informações de identificação pessoal (PII). Para obter mais informações sobre o uso de trabalhos de perfil para detectar PII, incluindo uma lista dos tipos de entidade que podem ser detectados, consulte a EntityDetectorConfiguration seção sobre configuração de PII em Criando uma configuração de trabalho de perfil programaticamente.