View a markdown version of this page

TOKENISASI - AWS Glue DataBrew Panduan Developer

Terjemahan disediakan oleh mesin penerjemah. Jika konten terjemahan yang diberikan bertentangan dengan versi bahasa Inggris aslinya, utamakan versi bahasa Inggris.

TOKENISASI

Membagi teks menjadi unit yang lebih kecil, atau token, seperti kata atau istilah individual.

Parameter
  • sourceColumn— Nama kolom yang ada.

  • delimiter— Sebuah pembatas kustom yang muncul di antara kata-kata tokenized. (Perilaku default adalah memisahkan setiap token dengan spasi.)

  • expandContractions— JikaENABLED, memperluas kata-kata yang dikontrak. Misalnya: “jangan” menjadi “jangan”.

  • stemmingModeMembagi teks menjadi unit atau token yang lebih kecil, seperti kata atau istilah huruf kecil individual. Dua mode stemming tersedia: PORTER |. LANCASTER

  • stopWordRemovalMode— Menghapus kata-kata umum seperti a, an, the, dan banyak lagi.

  • customStopWords— UntukStopWordRemovalMode, memungkinkan Anda untuk menentukan daftar kustom kata-kata berhenti.

  • targetColumn— Nama kolom yang berisi hasil.

contoh Contoh

{ "Action": { "Operation": "TOKENIZATION", "Parameters": { "customStopWords": "[]", "delimiter": "- ", "expandContractions": "ENABLED", "sourceColumn": "dimensions", "stemmingMode": "PORTER", "stopWordRemovalMode": "DEFAULT", "targetColumn": "dimensions_tokenized" } } }