View a markdown version of this page

字符化 - AWS Glue DataBrew開發人員指南

本文為英文版的機器翻譯版本,如內容有任何歧義或不一致之處,概以英文版為準。

字符化

將文字分割成較小的單位或字符,例如個別單字或詞彙。

Parameters
  • sourceColumn – 現有資料欄的名稱。

  • delimiter — 出現在字符化單字之間的自訂分隔符號。(預設行為是以空格分隔每個字符。)

  • expandContractions — 如果為 ENABLED, 會展開合約單字。例如:"don't" 會變成 "do not"。

  • stemmingMode — 將文字分割成較小的單位或字符,例如個別小寫單字或詞彙。有兩種主幹模式可用: PORTER | LANCASTER

  • stopWordRemovalMode — 移除常見字詞,例如 a、、 等。

  • customStopWords — 針對 StopWordRemovalMode, 可讓您指定停止單字的自訂清單。

  • targetColumn — 要包含結果的資料欄名稱。

範例範例

{ "Action": { "Operation": "TOKENIZATION", "Parameters": { "customStopWords": "[]", "delimiter": "- ", "expandContractions": "ENABLED", "sourceColumn": "dimensions", "stemmingMode": "PORTER", "stopWordRemovalMode": "DEFAULT", "targetColumn": "dimensions_tokenized" } } }