As traduções são geradas por tradução automática. Em caso de conflito entre o conteúdo da tradução e da versão original em inglês, a versão em inglês prevalecerá.
HealthOmics eTags e proveniência de dados
Uma HealthOmics ETag (tag de entidade) é um hash do conteúdo ingerido em um armazenamento de sequências. Isso simplifica a recuperação e o processamento de dados, mantendo a integridade do conteúdo dos arquivos de dados ingeridos. A ETag reflete as mudanças no conteúdo semântico do objeto, não em seus metadados. O tipo de conjunto de leitura e o algoritmo especificados determinam como a ETag é calculada. O cálculo da ETag não altera o arquivo real ou os dados genômicos. Quando o esquema de tipo de arquivo do conjunto de leitura permite, o armazenamento de sequências atualiza os campos vinculados à proveniência dos dados.
Os arquivos têm uma identidade bit a bit e uma identidade semântica. A identidade bit a bit significa que os bits de um arquivo são idênticos, e uma identidade semântica significa que o conteúdo de um arquivo é idêntico. A identidade semântica é resistente a alterações de metadados e alterações de compressão, pois captura a integridade do conteúdo do arquivo.
Os conjuntos de leitura em armazenamentos HealthOmics sequenciais passam por compression/decompression ciclos e rastreamento de proveniência de dados durante todo o ciclo de vida de um objeto. Durante esse processamento, a identidade bit a bit de um arquivo ingerido pode mudar e espera-se que mude sempre que um arquivo for ativado; no entanto, a identidade semântica do arquivo é mantida. A identidade semântica é capturada como uma tag de HealthOmics entidade, ou ETag, calculada durante a ingestão do armazenamento de sequências e disponível como metadados do conjunto de leitura.
Quando o esquema de tipo de arquivo do conjunto de leitura permite, os campos de atualizações do armazenamento de sequências são vinculados à proveniência dos dados. Para arquivos uBAM, BAM e CRAM, uma nova Comment tag @CO ou tag é adicionada ao cabeçalho. O comentário contém o ID do armazenamento da sequência e o carimbo de data/hora da ingestão.
Etiquetas eletrônicas do Amazon S3
Ao acessar um arquivo usando o URI do Amazon S3, as operações da API do Amazon S3 também podem retornar valores de ETag e soma de verificação do Amazon S3. Os valores de ETag e checksum do Amazon S3 diferem das HealthOmics ETags porque representam a identidade bit a bit do arquivo. Para saber mais sobre metadados descritivos e objetos, consulte a documentação da API de objetos do Amazon S3. Os valores de ETag do Amazon S3 podem mudar com cada ciclo de ativação de um conjunto de leitura e você pode usá-los para validar a leitura de um arquivo. No entanto, não armazene em cache os valores de ETag do Amazon S3 para usar na validação da identidade do arquivo durante o ciclo de vida do arquivo, pois eles não permanecem consistentes. Em contraste, a HealthOmics ETag permanece consistente durante todo o ciclo de vida do conjunto de leitura.
Como HealthOmics calcula ETags
A ETag é gerada a partir de um hash do conteúdo do arquivo ingerido. A família de algoritmos ETag é definida como MD5up por padrão, mas pode ser configurada de forma diferente durante a criação do armazenamento de sequências. Quando a ETag é calculada, o algoritmo e os hashes calculados são adicionados ao conjunto de leitura. Os algoritmos MD5 suportados para tipos de arquivo são os seguintes.
-
FASTQ_MD5Up — Calcula o hash MD5 de uma fonte de conjunto de leitura FASTQ completa e não compactada.
-
BAM_md5up — Calcula o hash MD5 da seção de alinhamento de uma fonte de conjunto de leitura BAM ou uBAM não compactada, conforme representada no SAM, com base na referência vinculada, se houver uma disponível.
-
CRAM_MD5UP — Calcula o hash MD5 da seção de alinhamento da fonte do conjunto de leitura CRAM não compactada, conforme representada no SAM, com base na referência vinculada.
nota
Sabe-se que o hashing MD5 é vulnerável a colisões. Por esse motivo, dois arquivos diferentes podem ter a mesma ETag se forem fabricados para explorar a colisão conhecida.
Os algoritmos a seguir são compatíveis com a família SHA256. Os algoritmos são calculados da seguinte forma:
-
FASTQ_SHA256up — Calcula o SHA-256 hash de uma fonte de conjunto de leitura FASTQ completa e não compactada.
-
BAM_SHA256up — Calcula o SHA-256 hash da seção de alinhamento de uma fonte de conjunto de leitura BAM ou uBAM não compactada, conforme representada no SAM, com base na referência vinculada, se houver uma disponível.
-
CRAM_SHA256up — Calcula o SHA-256 hash da seção de alinhamento de uma fonte de conjunto de leitura CRAM não compactada, conforme representada no SAM, com base na referência vinculada.
Os algoritmos a seguir são compatíveis com a família SHA512. Os algoritmos são calculados da seguinte forma:
-
FASTQ_SHA512up — Calcula o SHA-512 hash de uma fonte de conjunto de leitura FASTQ completa e não compactada.
-
BAM_SHA512up — Calcula o SHA-512 hash da seção de alinhamento de uma fonte de conjunto de leitura BAM ou uBAM não compactada, conforme representada no SAM, com base na referência vinculada, se houver uma disponível.
-
CRAM_SHA512up — Calcula o SHA-512 hash da seção de alinhamento de uma fonte de conjunto de leitura CRAM não compactada, conforme representada no SAM, com base na referência vinculada.