View a markdown version of this page

TOKENIZZAZIONE - AWS Glue DataBrew Guida per gli sviluppatori

Le traduzioni sono generate tramite traduzione automatica. In caso di conflitto tra il contenuto di una traduzione e la versione originale in Inglese, quest'ultima prevarrà.

TOKENIZZAZIONE

Divide il testo in unità più piccole, o token, ad esempio singole parole o termini.

Parameters
  • sourceColumn: il nome di una colonna esistente.

  • delimiter— Un delimitatore personalizzato che appare tra le parole tokenizzate. (Il comportamento predefinito consiste nel separare ogni token con uno spazio.)

  • expandContractions— SeENABLED, espande le parole contratte. Ad esempio: «non» diventa «non farlo».

  • stemmingMode— Divide il testo in unità o token più piccoli, ad esempio singole parole o termini minuscoli. Sono disponibili due modalità di derivazione: |. PORTER LANCASTER

  • stopWordRemovalMode— Rimuove parole comuni come a, an, the e altre.

  • customStopWords— PerStopWordRemovalMode, consente di specificare un elenco personalizzato di parole chiave.

  • targetColumn— Il nome di una colonna per contenere i risultati.

Esempio Esempio

{ "Action": { "Operation": "TOKENIZATION", "Parameters": { "customStopWords": "[]", "delimiter": "- ", "expandContractions": "ENABLED", "sourceColumn": "dimensions", "stemmingMode": "PORTER", "stopWordRemovalMode": "DEFAULT", "targetColumn": "dimensions_tokenized" } } }