View a markdown version of this page

Membangun konfigurasi pekerjaan profil secara terprogram di AWS Glue DataBrew - AWS Glue DataBrew Panduan Developer

Terjemahan disediakan oleh mesin penerjemah. Jika konten terjemahan yang diberikan bertentangan dengan versi bahasa Inggris aslinya, utamakan versi bahasa Inggris.

Membangun konfigurasi pekerjaan profil secara terprogram di AWS Glue DataBrew

Di bagian ini, Anda dapat menemukan deskripsi langkah dan fungsi pekerjaan profil yang dapat Anda gunakan secara terprogram. Anda dapat menggunakannya baik dari AWS Command Line Interface(AWS CLI) atau dengan menggunakan salah satu AWS SDK.

Dalam pekerjaan profil, Anda dapat menyesuaikan konfigurasi untuk mengontrol cara DataBrew mengevaluasi kumpulan data Anda. Anda dapat menerapkan konfigurasi ke kumpulan data atau menerapkannya ke kolom tertentu. Anda dapat membangun konfigurasi saat membuat pekerjaan profil, dan kemudian memperbaruinya kapan saja.

Struktur konfigurasi profil mencakup empat bagian:

Berikut adalah contohnya.

{ "ProfileColumns": [ { "Name": "example" }, { "Regex": "example.*" } ], "DatasetStatisticsConfiguration": { "IncludedStatistics": [ "CORRELATION" ], "Overrides": [ { "Statistic": "CORRELATION", "Parameters": { "columnSelectors": "[{\"name\":\"example\"}, {\"regex\":\"example.*\"}]" } } ] }, "ColumnStatisticsConfigurations": [ { "Selectors": [ { "Name": "example" } ], "Statistics": { "IncludedStatistics": [ "CORRELATION", "DUPLICATE_ROWS_COUNT" ], "Overrides": [ { "Statistic": "VALUE_DISTRIBUTION", "Parameters": { "binNumber": "10" } } ] } } ] }

ProfileColumns bagian

Di ProfileColumns bagian struktur Anda, atur kolom dari kumpulan data yang ingin Anda evaluasi dalam pekerjaan profil Anda. ProfileColumnsadalah daftar pemilih kolom (Selectors). Anda dapat menentukan nama kolom atau ekspresi reguler dalam pemilih kolom. Berikut contohnya.

"ProfileColumns": [{"Name": "example"}, {"Regex": "example.*"}]

Kapan ProfileColumns ditentukan, hanya kolom yang namanya cocok dengan nama atau ekspresi reguler ProfileColumns yang disertakan dalam pekerjaan profil. Jika pekerjaan profil tidak mendukung tipe data kolom yang dipilih, DataBrew lewati kolom yang dipilih selama pekerjaan dijalankan.

Jika tidak ProfileColumns ditentukan, pekerjaan profil mengevaluasi semua kolom yang didukung. Kolom yang didukung adalah kolom yang berisi data tipe data yang didukung: ByteTypeShortType,IntegerType,LongType,FloatType,DoubleType,,String, atauBoolean.

DatasetStatisticsConfiguration bagian

Di DatasetStatisticsConfiguration bagian struktur Anda, Anda dapat membangun konfigurasi untuk evaluasi antar kolom. Konfigurasi termasuk IncludedStatistics danOverrides. Berikut contohnya.

"DatasetStatisticsConfiguration": { "IncludedStatistics": ["CORRELATION"], "Overrides": [ { "Statistic": "CORRELATION", "Parameters": { "columnSelectors": "[{\"name\":\"example\"}, {\"regex\":\"example.*\"}]" } } ] }

Anda dapat memilih evaluasi yang ingin Anda miliki dengan menambahkan nama evaluasi. IncludedStatistics Berikut contohnya.

"IncludedStatistics": ["CORRELATION", "DUPLICATE_ROWS_COUNT"]

Saat Anda menentukanIncludedStatistics, hanya evaluasi dalam daftar yang disertakan dalam pekerjaan profil. Jika tidak IncludedStatistics ditentukan, pekerjaan profil menjalankan semua evaluasi yang didukung dengan pengaturan default. Anda dapat mengecualikan semua evaluasi dengan menambahkan NONE keIncludedStatistics. Berikut contohnya.

"IncludedStatistics": ["NONE"]

Statistik yang dapat dikonfigurasi pada tingkat dataset

Di DatasetStatisticsConfiguration bagian struktur Anda, pekerjaan profil mendukung evaluasi yang ditunjukkan pada tabel berikut.

Nama statistik Deskripsi Tipe data yang didukung Status default Atribut hasil profil Jenis hasil profil

DUPLIKATE_ROWS_COUNT

Hitungan baris duplikat dalam kumpulan data

all

Aktifkan

duplikat RowsCount

Int

KORELASI

Koefisien Korelasi Pearson antara dua kolom

number

Aktifkan

korelasi (di setiap kolom yang dipilih)

Objek

DiIncludedStatistics, Anda dapat mengganti setelan default setiap evaluasi dengan menambahkan penggantian. Setiap penggantian mencakup nama evaluasi tertentu dan peta parameter.

DiDatasetStatisticsConfiguration, pekerjaan profil mendukung CORRELATION penggantian. Penggantian ini menghitung Koefisien Korelasi Pearson antara dua kolom dari daftar kolom yang dipilih. Pengaturan default adalah memilih 10 kolom numerik pertama. Anda dapat menentukan sejumlah kolom atau daftar pemilih kolom untuk mengganti pengaturan default.

CORRELATIONmengambil parameter ini:

  • columnNumber— Jumlah kolom numerik. Pekerjaan profil memilih n kolom pertama dari kumpulan data. Nilai ini harus lebih besar dari 1. Gunakan "ALL" untuk memilih semua kolom numerik.

  • columnSelectors:— Daftar pemilih kolom. Setiap pemilih dapat memiliki nama kolom atau ekspresi reguler.

Berikut contohnya.

{ "Statistic": "CORRELATION", "Parameters": { "columnSelectors": "[{\"name\":\"example\"}, {\"regex\":\"example.*\"}]" } }

ColumnStatisticsConfigurations bagian

Di ColumnStatisticsConfigurations bagian struktur Anda, Anda dapat membangun konfigurasi untuk kolom tertentu. ColumnStatisticsConfigurationsadalah daftar ColumnStatisticsConfiguration pengaturan. DiColumnStatisticsConfiguration, adaSelectors, daftar pemilih kolom, dan Statistics untuk konfigurasi statistik. Berikut contohnya.

{ "Selectors": [{"Name": "example"} ], "Statistics": { "IncludedStatistics": ["CORRELATION", "DUPLICATE_ROWS_COUNT"] "Overrides": [ { "Statistic": "VALUE_DISTRIBUTION", "Parameters": { "binNumber": "10" } } ] } }

Selectorsadalah daftar pemilih kolom. Seperti halnyaProfileColumns, Anda dapat menentukan nama kolom atau ekspresi reguler di setiap pemilih kolom. Saat Anda menentukanSelectors, konfigurasi kolom diterapkan ke kolom yang cocok dengan pemilih kolom mana pun. Selectors Jika tidak, konfigurasi diterapkan ke semua kolom yang didukung.

DiStatistics, Anda dapat mengganti pengaturan kolom yang dipilih. Seperti halnyaDatasetStatisticsConfiguration, Statistics memiliki IncludedStatistics danOverrides.

Untuk memilih evaluasi yang Anda inginkan, tambahkan nama evaluasi keIncludedStatistics.

"IncludedStatistics": ["CORRELATION", "DUPLICATE_ROWS_COUNT"]

Saat Anda menentukanIncludedStatistics, hanya evaluasi dalam daftar yang disertakan dalam pekerjaan profil. Jika tidak, pekerjaan profil menjalankan semua evaluasi yang didukung dengan pengaturan default.

Anda dapat mengecualikan semua evaluasi dengan menambahkan NONE keIncludedStatistics.

"IncludedStatistics": ["NONE"]

Dalam beberapa kasus, mungkin ada beberapa konfigurasi yang berbeda ColumnStatisticsConfigurations IncludedStatistics yang dapat Anda terapkan ke kolom yang sama. Dalam kasus ini, pekerjaan profil memilih konfigurasi terakhir ColumnStatisticsConfigurations dan menerapkannya IncludedStatistics ke kolom yang dipilih. Konfigurasi baru mengesampingkan konfigurasi yang lebih lama.

Statistik yang dapat dikonfigurasi di tingkat kolom

DiColumnStatisticsConfigurations, pekerjaan profil mendukung evaluasi yang ditunjukkan pada tabel berikut.

Tipe data yang didukung number dalam tabel ini berarti bahwa tipe data atribut adalah salah satu dari berikut:ByteType,ShortType,IntegerType,LongType,FloatType, atauDoubleType.

Nama statistik Deskripsi Tipe data yang didukung Status default Atribut hasil profil Jenis hasil profil

Nama kolomnya.

all

name

string

Tipe data kolom.

all

jenis

string

DISTINCT_VALUES_COUNT

Jumlah nilai yang berbeda. Nilai yang berbeda adalah nilai yang muncul setidaknya sekali.

number/boolean/string

Diaktifkan

berbeda ValuesCount

Int

ENTROPI

Entropi (teori informasi).

number/boolean/string

Diaktifkan

entropi

Ganda

INTER_QUARTILE_RANGE

Kisaran antara 25 persen dan 75 persen dari angka.

number

Diaktifkan

InterQuartileRange

Ganda

KURTOSIS

Kurtosis kolom.

number

Diaktifkan

kurtosis

Ganda

MAX

Nilai maksimum di kolom.

number/string panjang

Diaktifkan

max

Int/Double

MAXIMUM_VALUES

Daftar nilai maksimum di kolom dan hitungannya.

number

Diaktifkan

MaximumValues

Daftar

MEAN

Nilai rata-rata nilai di kolom.

number/string panjang

Diaktifkan

kejam

Ganda

MEDIAN

Median nilai di kolom.

number/string panjang

Diaktifkan

median

Ganda

MEDIAN_ABSOLUTE_DEVIASI

Median perbedaan absolut antara setiap titik data dan median kolom numerik.

number

Diaktifkan

median AbsoluteDeviation

Ganda

MIN

Nilai minimum di kolom.

number/string panjang

Diaktifkan

min

Int/Double

MINIMUM_VALUES

Daftar nilai minimum di kolom dan hitungannya.

number

Diaktifkan

MinimumValues

Daftar

HILANG_VALUES_COUNT

Jumlah nilai yang hilang di kolom. String nol dan kosong dianggap hilang.

all

Diaktifkan

hilang ValuesCount

Int

MODE

Nilai yang paling sering terjadi di kolom. Jika beberapa nilai sering muncul, mode adalah salah satu nilai tersebut.

number/string panjang

Diaktifkan

Mode

Int/Double

MOST_COMMON_VALUES

Daftar nilai yang paling umum di kolom.

number/boolean/string

Diaktifkan

paling CommonValues

Daftar

OUTLIER_DETECTION

Mendeteksi outlier di kolom dengan algoritma Z_score. Hitung jumlah outlier dan ekstrak daftar sampel dari outlier yang terdeteksi.

number/string panjang

Diaktifkan

zScoreOutliersCount, z ScoreOutliersSample

Int/List

PERSENTIL

Nilai persentil kolom numerik (5%, 25%, 75%, 95%).

number

Diaktifkan

persentil5, persentil25, persentil75, persentil95

Ganda

RANGE

Rentang nilai di kolom.

number

Diaktifkan

jangkauan

Int/Double

KEMIRINGAN

Kemiringan nilai di kolom.

number

Diaktifkan

kemiringan

Ganda

STANDARD_DEVIASI

Deviasi standar sampel yang tidak bias dari nilai di kolom.

number/string panjang

Diaktifkan

StandarDeviasi

Ganda

JUMLAH

Jumlah nilai di kolom.

number

Diaktifkan

sum

Int/Double

UNIK_VALUES_COUNT

Jumlah nilai unik. Nilai unik berarti bahwa nilai hanya muncul sekali.

number/boolean/string

Diaktifkan

unik ValuesCount

Int

VALUE_DISTRIBUTION

Ukur distribusi nilai dalam kolom berdasarkan rentang.

number/string panjang

Diaktifkan

Distribusi Nilai

Daftar

PERBEDAAN

Varians nilai di kolom.

number

Diaktifkan

perbedaan

Ganda

Z_SCORE_DISTRIBUTION

Ukur distribusi nilai z-skor titik data berdasarkan rentang.

number

Diaktifkan

z ScoreDistribution

Daftar

ZEROS_COUNT

Jumlah nol (0s) di kolom.

number

Diaktifkan

ZerosCount

Int

DiIncludedStatistics, Anda dapat mengganti setiap parameter default evaluasi dengan menambahkan override. Setiap penggantian mencakup nama evaluasi tertentu dan peta parameter.

Parameter untuk ColumnStatisticsConfigurations kolom

DiColumnStatisticsConfigurations, pekerjaan profil mendukung parameter berikut.

Dalam beberapa kasus, mungkin ada beberapa konfigurasi yang berbeda ColumnStatisticsConfigurations IncludedStatistics yang dapat Anda terapkan ke kolom yang sama. Dalam kasus ini, pekerjaan profil memilih konfigurasi terakhir ColumnStatisticsConfigurations dan menerapkannya IncludedStatistics ke kolom yang dipilih. Konfigurasi baru mengesampingkan konfigurasi yang lebih lama.

MAXIMUM_VALUES

Daftar nilai maksimum di kolom numerik dan jumlahnya. Ukuran daftar default adalah 5. Anda dapat mengganti ukuran daftar dengan menentukan nilai untuk. sampleSize

Pengaturan

sampleSize— Ukuran daftar yang mencakup jumlah maksimum dan jumlah nilai dalam kolom numerik. Nilai ini harus lebih besar dari 0. Gunakan "ALL" untuk daftar semua nilai.

Contoh

{ "Statistic": "MAXIMUM_VALUES", "Parameters": { "sampleSize": "5" } }

MINIMUM_VALUES

Daftar nilai minimum di kolom numerik dan jumlahnya. Ukuran daftar default adalah 5. Anda dapat mengganti ukuran daftar dengan menentukan nilai untuk. sampleSize

Pengaturan

sampleSize— Ukuran daftar yang mencakup jumlah maksimum dan jumlah nilai dalam kolom numerik. Nilai ini harus lebih besar dari 0. Gunakan "ALL" untuk daftar semua nilai.

Contoh

{ "Statistic": "MINIMUM_VALUES", "Parameters": { "sampleSize": "5" } }

MOST_COMMON_VALUES

Daftar nilai yang paling umum di kolom dan jumlahnya. Ukuran daftar default adalah 50. Anda dapat mengganti ukuran daftar dengan menentukan nilai untuk. sampleSize

Pengaturan

sampleSize— Ukuran daftar yang mencakup jumlah maksimum dan jumlah nilai dalam kolom numerik. Nilai ini harus lebih besar dari 0. Gunakan "ALL" untuk daftar semua nilai.

Contoh

{ "Statistic": "MOST_COMMON_VALUES", "Parameters": { "sampleSize": "50" } }

OUTLIER_DETECTION

Mendeteksi outlier di kolom numerik atau kolom string (berdasarkan panjang string) dengan algoritma Z_score.

Pekerjaan profil Anda menghitung jumlah outlier dan menghasilkan daftar sampel outlier dan z-score mereka. Daftar sampel diurutkan berdasarkan nilai absolut skor-z. Ukuran daftar default adalah 50.

Algoritma Z_Score mengidentifikasi nilai sebagai outlier ketika menyimpang dari rata-rata dengan lebih dari ambang standar deviasi. Ambang batas outlier default adalah 3.

Anda dapat memberikan satu ambang batas lagi, ambang batas ringan, untuk mendapatkan informasi lebih lanjut. Ambang batas ringan Anda harus kurang dari ambang batas Anda. Fitur ini dimatikan secara default. Ketika ambang batas ringan ditentukan, pekerjaan profil Anda mengembalikan satu hitungan lagi,zScoreMildOutliersCount. Juga, zScoreOutliersSample dapat mencakup sampel outlier ambang batas ringan dalam kasus ini.

Pengaturan

  • threshold— Nilai ambang yang digunakan saat mendeteksi outlier. Nilai ini harus lebih besar atau sama dengan 0.

  • mildThreshold— Nilai ambang batas ringan untuk digunakan saat mendeteksi outlier. Nilai ini harus lebih besar atau sama dengan 0 dan kurang darithreshold.

  • sampleSize— Ukuran daftar yang mencakup outlier di kolom. Gunakan "ALL" untuk daftar semua nilai.

Contoh

{ "Statistic": "OUTLIER_DETECTION", "Parameters": { "threshold": "5", "mildThreshold": "3.5", "sampleSize": "20" } }

VALUE_DISTRIBUTION

Mengukur distribusi nilai di kolom dengan rentang nilai. Pekerjaan profil mengelompokkan nilai dari kolom numerik atau kolom string (berdasarkan panjang string) ke dalam bin berdasarkan rentang numerik, dan menghasilkan daftar bin. Tempat sampah berurutan, dan batas atas untuk ember adalah batas bawah untuk ember berikutnya.

Pengaturan

binNumber— Jumlah tempat sampah. Nilai ini harus lebih besar dari 0.

Contoh

{ "Statistic": "VALUE_DISTRIBUTION", "Parameters": { "binNumber": "5" } }

Z_SCORE_DISTRIBUTION

Mengukur distribusi nilai z-skor di kolom numerik. Pekerjaan profil mengelompokkan z-skor nilai ke dalam bin berdasarkan rentang numerik, dan menghasilkan daftar tempat sampah. Tempat sampah berurutan, dan batas atas untuk ember adalah batas bawah untuk ember berikutnya.

Pengaturan

binNumber— Jumlah tempat sampah. Nilai ini harus lebih besar dari 0.

Contoh

{ "Statistic": "Z_SCORE_DISTRIBUTION", "Parameters": { "binNumber": "5" } }

EntityDetectorConfiguration bagian untuk mengkonfigurasi PII

Di EntityDetectorConfiguration bagian struktur Anda, Anda dapat mengonfigurasi jenis entitas dalam kumpulan data yang DataBrew ingin Anda deteksi sebagai informasi identifikasi pribadi (PII) untuk pekerjaan profil.

EntityTypes

Anda mengonfigurasi jenis entitas yang DataBrew ingin Anda deteksi sebagai PII untuk pekerjaan profil Anda. Kapan tidak EntityDetectorConfiguration terdefinisi, deteksi entitas dinonaktifkan. Jenis entitas berikut dapat dideteksi dalam kumpulan data Anda:

  • USA_SSN

  • Email

  • USA_ITIN

  • USA_PASSPORT_NUMBER

  • TELEPON_NOMOR

  • USA_DRIVING_LICENSE

  • BANK_ACCOUNT

  • KARTU KREDIT

  • IP_ALAMAT

  • ALAMAT MAC_

  • USA_DEA_NUMBER

  • USA_HCPCS_CODE

  • USA_NATIONAL_PROVIDER_IDENTIFIER

  • USA_NATIONAL_DRUG_CODE

  • USA_HEALTH_INSURANCE_CLAIM_NUMBER

  • USA_MEDICARE_BENEFICIARY_IDENTIFIER

  • USA_CPT_CODE

  • PERSON_NAME

  • DATE

Grup tipe entitas juga USA_ALL didukung, dan mencakup semua jenis entitas di atas kecuali PERSON_NAME danDATE.

Tipe EntityTypes adalah array string.

AllowedStatistics

Konfigurasikan statistik yang diizinkan untuk dijalankan pada kolom yang berisi entitas yang terdeteksi. Jika tidak AllowedStatistics terdefinisi, tidak ada statistik yang akan dihitung pada kolom yang berisi entitas yang terdeteksi. Lihat Statistik yang dapat dikonfigurasi di tingkat kolom daftar nilai yang valid untuk AllowedStatistics parameter.

Tipe AllowedStatistics adalah array AllowedStatistics objek.