Les traductions sont fournies par des outils de traduction automatique. En cas de conflit entre le contenu d'une traduction et celui de la version originale en anglais, la version anglaise prévaudra.
TOKENISATION
Divise le texte en unités plus petites, ou jetons, tels que des mots ou des termes individuels.
Parameters
-
sourceColumn: nom d’une colonne existante. -
delimiter— Un séparateur personnalisé qui apparaît entre les mots tokenisés. (Le comportement par défaut consiste à séparer chaque jeton par un espace.) -
expandContractions— SiENABLED, développe les mots contractés. Par exemple : « ne pas » devient « ne pas ». -
stemmingMode— Divise le texte en unités ou en jetons plus petits, tels que des mots ou termes minuscules individuels. Deux modes de découpage sont disponibles :PORTER|LANCASTER. -
stopWordRemovalMode— Supprime les mots courants tels que a, an, le, etc. -
customStopWords— PourStopWordRemovalMode, vous permet de définir une liste personnalisée de mots vides. -
targetColumn— Le nom de la colonne qui doit contenir les résultats.
Exemple Exemple
{ "Action": { "Operation": "TOKENIZATION", "Parameters": { "customStopWords": "[]", "delimiter": "- ", "expandContractions": "ENABLED", "sourceColumn": "dimensions", "stemmingMode": "PORTER", "stopWordRemovalMode": "DEFAULT", "targetColumn": "dimensions_tokenized" } } }