Terjemahan disediakan oleh mesin penerjemah. Jika konten terjemahan yang diberikan bertentangan dengan versi bahasa Inggris aslinya, utamakan versi bahasa Inggris.
Membangun konfigurasi pekerjaan profil secara terprogram di AWS Glue DataBrew
Di bagian ini, Anda dapat menemukan deskripsi langkah dan fungsi pekerjaan profil yang dapat Anda gunakan secara terprogram. Anda dapat menggunakannya baik dari AWS Command Line Interface(AWS CLI) atau dengan menggunakan salah satu AWS SDK.
Dalam pekerjaan profil, Anda dapat menyesuaikan konfigurasi untuk mengontrol cara DataBrew mengevaluasi kumpulan data Anda. Anda dapat menerapkan konfigurasi ke kumpulan data atau menerapkannya ke kolom tertentu. Anda dapat membangun konfigurasi saat membuat pekerjaan profil, dan kemudian memperbaruinya kapan saja.
Struktur konfigurasi profil mencakup empat bagian:
Berikut adalah contohnya.
{ "ProfileColumns": [ { "Name": "example" }, { "Regex": "example.*" } ], "DatasetStatisticsConfiguration": { "IncludedStatistics": [ "CORRELATION" ], "Overrides": [ { "Statistic": "CORRELATION", "Parameters": { "columnSelectors": "[{\"name\":\"example\"}, {\"regex\":\"example.*\"}]" } } ] }, "ColumnStatisticsConfigurations": [ { "Selectors": [ { "Name": "example" } ], "Statistics": { "IncludedStatistics": [ "CORRELATION", "DUPLICATE_ROWS_COUNT" ], "Overrides": [ { "Statistic": "VALUE_DISTRIBUTION", "Parameters": { "binNumber": "10" } } ] } } ] }
ProfileColumns bagian
Di ProfileColumns bagian struktur Anda, atur kolom dari kumpulan data yang ingin Anda evaluasi dalam pekerjaan profil Anda. ProfileColumnsadalah daftar pemilih kolom (Selectors). Anda dapat menentukan nama kolom atau ekspresi reguler dalam pemilih kolom. Berikut contohnya.
"ProfileColumns": [{"Name": "example"}, {"Regex": "example.*"}]
Kapan ProfileColumns ditentukan, hanya kolom yang namanya cocok dengan nama atau ekspresi reguler ProfileColumns yang disertakan dalam pekerjaan profil. Jika pekerjaan profil tidak mendukung tipe data kolom yang dipilih, DataBrew lewati kolom yang dipilih selama pekerjaan dijalankan.
Jika tidak ProfileColumns ditentukan, pekerjaan profil mengevaluasi semua kolom yang didukung. Kolom yang didukung adalah kolom yang berisi data tipe data yang didukung: ByteTypeShortType,IntegerType,LongType,FloatType,DoubleType,,String, atauBoolean.
DatasetStatisticsConfiguration bagian
Di DatasetStatisticsConfiguration bagian struktur Anda, Anda dapat membangun konfigurasi untuk evaluasi antar kolom. Konfigurasi termasuk IncludedStatistics danOverrides. Berikut contohnya.
"DatasetStatisticsConfiguration": { "IncludedStatistics": ["CORRELATION"], "Overrides": [ { "Statistic": "CORRELATION", "Parameters": { "columnSelectors": "[{\"name\":\"example\"}, {\"regex\":\"example.*\"}]" } } ] }
Anda dapat memilih evaluasi yang ingin Anda miliki dengan menambahkan nama evaluasi. IncludedStatistics Berikut contohnya.
"IncludedStatistics": ["CORRELATION", "DUPLICATE_ROWS_COUNT"]
Saat Anda menentukanIncludedStatistics, hanya evaluasi dalam daftar yang disertakan dalam pekerjaan profil. Jika tidak IncludedStatistics ditentukan, pekerjaan profil menjalankan semua evaluasi yang didukung dengan pengaturan default. Anda dapat mengecualikan semua evaluasi dengan menambahkan NONE keIncludedStatistics. Berikut contohnya.
"IncludedStatistics": ["NONE"]
Statistik yang dapat dikonfigurasi pada tingkat dataset
Di DatasetStatisticsConfiguration bagian struktur Anda, pekerjaan profil mendukung evaluasi yang ditunjukkan pada tabel berikut.
| Nama statistik | Deskripsi | Tipe data yang didukung | Status default | Atribut hasil profil | Jenis hasil profil |
|---|---|---|---|---|---|
DUPLIKATE_ROWS_COUNT |
Hitungan baris duplikat dalam kumpulan data |
all |
Aktifkan |
duplikat RowsCount |
Int |
KORELASI |
Koefisien Korelasi Pearson antara dua kolom |
number |
Aktifkan |
korelasi (di setiap kolom yang dipilih) |
Objek |
DiIncludedStatistics, Anda dapat mengganti setelan default setiap evaluasi dengan menambahkan penggantian. Setiap penggantian mencakup nama evaluasi tertentu dan peta parameter.
DiDatasetStatisticsConfiguration, pekerjaan profil mendukung CORRELATION penggantian. Penggantian ini menghitung Koefisien Korelasi Pearson antara dua kolom dari daftar kolom yang dipilih. Pengaturan default adalah memilih 10 kolom numerik pertama. Anda dapat menentukan sejumlah kolom atau daftar pemilih kolom untuk mengganti pengaturan default.
CORRELATIONmengambil parameter ini:
columnNumber— Jumlah kolom numerik. Pekerjaan profil memilih n kolom pertama dari kumpulan data. Nilai ini harus lebih besar dari 1. Gunakan"ALL"untuk memilih semua kolom numerik.columnSelectors:— Daftar pemilih kolom. Setiap pemilih dapat memiliki nama kolom atau ekspresi reguler.
Berikut contohnya.
{ "Statistic": "CORRELATION", "Parameters": { "columnSelectors": "[{\"name\":\"example\"}, {\"regex\":\"example.*\"}]" } }
ColumnStatisticsConfigurations bagian
Di ColumnStatisticsConfigurations bagian struktur Anda, Anda dapat membangun konfigurasi untuk kolom tertentu. ColumnStatisticsConfigurationsadalah daftar ColumnStatisticsConfiguration pengaturan. DiColumnStatisticsConfiguration, adaSelectors, daftar pemilih kolom, dan Statistics untuk konfigurasi statistik. Berikut contohnya.
{ "Selectors": [{"Name": "example"} ], "Statistics": { "IncludedStatistics": ["CORRELATION", "DUPLICATE_ROWS_COUNT"] "Overrides": [ { "Statistic": "VALUE_DISTRIBUTION", "Parameters": { "binNumber": "10" } } ] } }
Selectorsadalah daftar pemilih kolom. Seperti halnyaProfileColumns, Anda dapat menentukan nama kolom atau ekspresi reguler di setiap pemilih kolom. Saat Anda menentukanSelectors, konfigurasi kolom diterapkan ke kolom yang cocok dengan pemilih kolom mana pun. Selectors Jika tidak, konfigurasi diterapkan ke semua kolom yang didukung.
DiStatistics, Anda dapat mengganti pengaturan kolom yang dipilih. Seperti halnyaDatasetStatisticsConfiguration, Statistics memiliki IncludedStatistics danOverrides.
Untuk memilih evaluasi yang Anda inginkan, tambahkan nama evaluasi keIncludedStatistics.
"IncludedStatistics": ["CORRELATION", "DUPLICATE_ROWS_COUNT"]
Saat Anda menentukanIncludedStatistics, hanya evaluasi dalam daftar yang disertakan dalam pekerjaan profil. Jika tidak, pekerjaan profil menjalankan semua evaluasi yang didukung dengan pengaturan default.
Anda dapat mengecualikan semua evaluasi dengan menambahkan NONE keIncludedStatistics.
"IncludedStatistics": ["NONE"]
Dalam beberapa kasus, mungkin ada beberapa konfigurasi yang berbeda ColumnStatisticsConfigurations IncludedStatistics yang dapat Anda terapkan ke kolom yang sama. Dalam kasus ini, pekerjaan profil memilih konfigurasi terakhir ColumnStatisticsConfigurations dan menerapkannya IncludedStatistics ke kolom yang dipilih. Konfigurasi baru mengesampingkan konfigurasi yang lebih lama.
Statistik yang dapat dikonfigurasi di tingkat kolom
DiColumnStatisticsConfigurations, pekerjaan profil mendukung evaluasi yang ditunjukkan pada tabel berikut.
Tipe data yang didukung number dalam tabel ini berarti bahwa tipe data atribut adalah salah satu dari berikut:ByteType,ShortType,IntegerType,LongType,FloatType, atauDoubleType.
| Nama statistik | Deskripsi | Tipe data yang didukung | Status default | Atribut hasil profil | Jenis hasil profil |
|---|---|---|---|---|---|
– |
Nama kolomnya. |
all |
– |
name |
string |
– |
Tipe data kolom. |
all |
– |
jenis |
string |
DISTINCT_VALUES_COUNT |
Jumlah nilai yang berbeda. Nilai yang berbeda adalah nilai yang muncul setidaknya sekali. |
number/boolean/string |
Diaktifkan |
berbeda ValuesCount |
Int |
ENTROPI |
Entropi (teori informasi). |
number/boolean/string |
Diaktifkan |
entropi |
Ganda |
INTER_QUARTILE_RANGE |
Kisaran antara 25 persen dan 75 persen dari angka. |
number |
Diaktifkan |
InterQuartileRange |
Ganda |
KURTOSIS |
Kurtosis kolom. |
number |
Diaktifkan |
kurtosis |
Ganda |
MAX |
Nilai maksimum di kolom. |
number/string panjang |
Diaktifkan |
max |
Int/Double |
MAXIMUM_VALUES |
Daftar nilai maksimum di kolom dan hitungannya. |
number |
Diaktifkan |
MaximumValues |
Daftar |
MEAN |
Nilai rata-rata nilai di kolom. |
number/string panjang |
Diaktifkan |
kejam |
Ganda |
MEDIAN |
Median nilai di kolom. |
number/string panjang |
Diaktifkan |
median |
Ganda |
MEDIAN_ABSOLUTE_DEVIASI |
Median perbedaan absolut antara setiap titik data dan median kolom numerik. |
number |
Diaktifkan |
median AbsoluteDeviation |
Ganda |
MIN |
Nilai minimum di kolom. |
number/string panjang |
Diaktifkan |
min |
Int/Double |
MINIMUM_VALUES |
Daftar nilai minimum di kolom dan hitungannya. |
number |
Diaktifkan |
MinimumValues |
Daftar |
HILANG_VALUES_COUNT |
Jumlah nilai yang hilang di kolom. String nol dan kosong dianggap hilang. |
all |
Diaktifkan |
hilang ValuesCount |
Int |
MODE |
Nilai yang paling sering terjadi di kolom. Jika beberapa nilai sering muncul, mode adalah salah satu nilai tersebut. |
number/string panjang |
Diaktifkan |
Mode |
Int/Double |
MOST_COMMON_VALUES |
Daftar nilai yang paling umum di kolom. |
number/boolean/string |
Diaktifkan |
paling CommonValues |
Daftar |
OUTLIER_DETECTION |
Mendeteksi outlier di kolom dengan algoritma Z_score. Hitung jumlah outlier dan ekstrak daftar sampel dari outlier yang terdeteksi. |
number/string panjang |
Diaktifkan |
zScoreOutliersCount, z ScoreOutliersSample |
Int/List |
PERSENTIL |
Nilai persentil kolom numerik (5%, 25%, 75%, 95%). |
number |
Diaktifkan |
persentil5, persentil25, persentil75, persentil95 |
Ganda |
RANGE |
Rentang nilai di kolom. |
number |
Diaktifkan |
jangkauan |
Int/Double |
KEMIRINGAN |
Kemiringan nilai di kolom. |
number |
Diaktifkan |
kemiringan |
Ganda |
STANDARD_DEVIASI |
Deviasi standar sampel yang tidak bias dari nilai di kolom. |
number/string panjang |
Diaktifkan |
StandarDeviasi |
Ganda |
JUMLAH |
Jumlah nilai di kolom. |
number |
Diaktifkan |
sum |
Int/Double |
UNIK_VALUES_COUNT |
Jumlah nilai unik. Nilai unik berarti bahwa nilai hanya muncul sekali. |
number/boolean/string |
Diaktifkan |
unik ValuesCount |
Int |
VALUE_DISTRIBUTION |
Ukur distribusi nilai dalam kolom berdasarkan rentang. |
number/string panjang |
Diaktifkan |
Distribusi Nilai |
Daftar |
PERBEDAAN |
Varians nilai di kolom. |
number |
Diaktifkan |
perbedaan |
Ganda |
Z_SCORE_DISTRIBUTION |
Ukur distribusi nilai z-skor titik data berdasarkan rentang. |
number |
Diaktifkan |
z ScoreDistribution |
Daftar |
ZEROS_COUNT |
Jumlah nol (0s) di kolom. |
number |
Diaktifkan |
ZerosCount |
Int |
DiIncludedStatistics, Anda dapat mengganti setiap parameter default evaluasi dengan menambahkan override. Setiap penggantian mencakup nama evaluasi tertentu dan peta parameter.
Parameter untuk ColumnStatisticsConfigurations kolom
DiColumnStatisticsConfigurations, pekerjaan profil mendukung parameter berikut.
Dalam beberapa kasus, mungkin ada beberapa konfigurasi yang berbeda ColumnStatisticsConfigurations IncludedStatistics yang dapat Anda terapkan ke kolom yang sama. Dalam kasus ini, pekerjaan profil memilih konfigurasi terakhir ColumnStatisticsConfigurations dan menerapkannya IncludedStatistics ke kolom yang dipilih. Konfigurasi baru mengesampingkan konfigurasi yang lebih lama.
MAXIMUM_VALUES
Daftar nilai maksimum di kolom numerik dan jumlahnya. Ukuran daftar default adalah 5. Anda dapat mengganti ukuran daftar dengan menentukan nilai untuk. sampleSize
Pengaturan
sampleSize— Ukuran daftar yang mencakup jumlah maksimum dan jumlah nilai dalam kolom numerik. Nilai ini harus lebih besar dari 0. Gunakan "ALL" untuk daftar semua nilai.
Contoh
{ "Statistic": "MAXIMUM_VALUES", "Parameters": { "sampleSize": "5" } }
MINIMUM_VALUES
Daftar nilai minimum di kolom numerik dan jumlahnya. Ukuran daftar default adalah 5. Anda dapat mengganti ukuran daftar dengan menentukan nilai untuk. sampleSize
Pengaturan
sampleSize— Ukuran daftar yang mencakup jumlah maksimum dan jumlah nilai dalam kolom numerik. Nilai ini harus lebih besar dari 0. Gunakan "ALL" untuk daftar semua nilai.
Contoh
{ "Statistic": "MINIMUM_VALUES", "Parameters": { "sampleSize": "5" } }
MOST_COMMON_VALUES
Daftar nilai yang paling umum di kolom dan jumlahnya. Ukuran daftar default adalah 50. Anda dapat mengganti ukuran daftar dengan menentukan nilai untuk. sampleSize
Pengaturan
sampleSize— Ukuran daftar yang mencakup jumlah maksimum dan jumlah nilai dalam kolom numerik. Nilai ini harus lebih besar dari 0. Gunakan "ALL" untuk daftar semua nilai.
Contoh
{ "Statistic": "MOST_COMMON_VALUES", "Parameters": { "sampleSize": "50" } }
OUTLIER_DETECTION
Mendeteksi outlier di kolom numerik atau kolom string (berdasarkan panjang string) dengan algoritma Z_score.
Pekerjaan profil Anda menghitung jumlah outlier dan menghasilkan daftar sampel outlier dan z-score mereka. Daftar sampel diurutkan berdasarkan nilai absolut skor-z. Ukuran daftar default adalah 50.
Algoritma Z_Score mengidentifikasi nilai sebagai outlier ketika menyimpang dari rata-rata dengan lebih dari ambang standar deviasi. Ambang batas outlier default adalah 3.
Anda dapat memberikan satu ambang batas lagi, ambang batas ringan, untuk mendapatkan informasi lebih lanjut. Ambang batas ringan Anda harus kurang dari ambang batas Anda. Fitur ini dimatikan secara default. Ketika ambang batas ringan ditentukan, pekerjaan profil Anda mengembalikan satu hitungan lagi,zScoreMildOutliersCount. Juga, zScoreOutliersSample dapat mencakup sampel outlier ambang batas ringan dalam kasus ini.
Pengaturan
threshold— Nilai ambang yang digunakan saat mendeteksi outlier. Nilai ini harus lebih besar atau sama dengan 0.mildThreshold— Nilai ambang batas ringan untuk digunakan saat mendeteksi outlier. Nilai ini harus lebih besar atau sama dengan 0 dan kurang darithreshold.sampleSize— Ukuran daftar yang mencakup outlier di kolom. Gunakan"ALL"untuk daftar semua nilai.
Contoh
{ "Statistic": "OUTLIER_DETECTION", "Parameters": { "threshold": "5", "mildThreshold": "3.5", "sampleSize": "20" } }
VALUE_DISTRIBUTION
Mengukur distribusi nilai di kolom dengan rentang nilai. Pekerjaan profil mengelompokkan nilai dari kolom numerik atau kolom string (berdasarkan panjang string) ke dalam bin berdasarkan rentang numerik, dan menghasilkan daftar bin. Tempat sampah berurutan, dan batas atas untuk ember adalah batas bawah untuk ember berikutnya.
Pengaturan
binNumber— Jumlah tempat sampah. Nilai ini harus lebih besar dari 0.
Contoh
{ "Statistic": "VALUE_DISTRIBUTION", "Parameters": { "binNumber": "5" } }
Z_SCORE_DISTRIBUTION
Mengukur distribusi nilai z-skor di kolom numerik. Pekerjaan profil mengelompokkan z-skor nilai ke dalam bin berdasarkan rentang numerik, dan menghasilkan daftar tempat sampah. Tempat sampah berurutan, dan batas atas untuk ember adalah batas bawah untuk ember berikutnya.
Pengaturan
binNumber— Jumlah tempat sampah. Nilai ini harus lebih besar dari 0.
Contoh
{ "Statistic": "Z_SCORE_DISTRIBUTION", "Parameters": { "binNumber": "5" } }
EntityDetectorConfiguration bagian untuk mengkonfigurasi PII
Di EntityDetectorConfiguration bagian struktur Anda, Anda dapat mengonfigurasi jenis entitas dalam kumpulan data yang DataBrew ingin Anda deteksi sebagai informasi identifikasi pribadi (PII) untuk pekerjaan profil.
EntityTypes
Anda mengonfigurasi jenis entitas yang DataBrew ingin Anda deteksi sebagai PII untuk pekerjaan profil Anda. Kapan tidak EntityDetectorConfiguration terdefinisi, deteksi entitas dinonaktifkan. Jenis entitas berikut dapat dideteksi dalam kumpulan data Anda:
USA_SSN
Email
USA_ITIN
USA_PASSPORT_NUMBER
TELEPON_NOMOR
USA_DRIVING_LICENSE
BANK_ACCOUNT
KARTU KREDIT
IP_ALAMAT
ALAMAT MAC_
USA_DEA_NUMBER
USA_HCPCS_CODE
USA_NATIONAL_PROVIDER_IDENTIFIER
USA_NATIONAL_DRUG_CODE
USA_HEALTH_INSURANCE_CLAIM_NUMBER
USA_MEDICARE_BENEFICIARY_IDENTIFIER
USA_CPT_CODE
PERSON_NAME
DATE
Grup tipe entitas juga USA_ALL didukung, dan mencakup semua jenis entitas di atas kecuali PERSON_NAME danDATE.
Tipe EntityTypes adalah array string.
AllowedStatistics
Konfigurasikan statistik yang diizinkan untuk dijalankan pada kolom yang berisi entitas yang terdeteksi. Jika tidak AllowedStatistics terdefinisi, tidak ada statistik yang akan dihitung pada kolom yang berisi entitas yang terdeteksi. Lihat Statistik yang dapat dikonfigurasi di tingkat kolom daftar nilai yang valid untuk AllowedStatistics parameter.
Tipe AllowedStatistics adalah array AllowedStatistics objek.