기계 번역으로 제공되는 번역입니다. 제공된 번역과 원본 영어의 내용이 상충하는 경우에는 영어 버전이 우선합니다.
에서 프로그래밍 방식으로 프로파일 작업 구성 빌드AWS Glue DataBrew
이 섹션에서는 프로그래밍 방식으로 사용할 수 있는 프로필 작업 단계 및 함수에 대한 설명을 찾을 수 있습니다.AWS Command Line Interface(AWS CLI)에서 또는AWS SDKs.
프로필 작업에서 구성을 사용자 지정하여 DataBrew가 데이터 세트를 평가하는 방법을 제어할 수 있습니다. 구성을 데이터 세트에 적용하거나 특정 열에 적용할 수 있습니다. 프로필 작업을 생성할 때 구성을 빌드한 다음 언제든지 업데이트할 수 있습니다.
프로필 구성 구조는 네 부분으로 구성됩니다.
다음은 한 예입니다.
{ "ProfileColumns": [ { "Name": "example" }, { "Regex": "example.*" } ], "DatasetStatisticsConfiguration": { "IncludedStatistics": [ "CORRELATION" ], "Overrides": [ { "Statistic": "CORRELATION", "Parameters": { "columnSelectors": "[{\"name\":\"example\"}, {\"regex\":\"example.*\"}]" } } ] }, "ColumnStatisticsConfigurations": [ { "Selectors": [ { "Name": "example" } ], "Statistics": { "IncludedStatistics": [ "CORRELATION", "DUPLICATE_ROWS_COUNT" ], "Overrides": [ { "Statistic": "VALUE_DISTRIBUTION", "Parameters": { "binNumber": "10" } } ] } } ] }
ProfileColumns 섹션
구조의 ProfileColumns 섹션에서 프로필 작업에서 평가하려는 데이터 세트의 열을 설정합니다. ProfileColumns는 열 선택기 목록(Selectors)입니다. 열 선택기에서 열 이름 또는 정규식을 지정할 수 있습니다. 예를 들면 다음과 같습니다.
"ProfileColumns": [{"Name": "example"}, {"Regex": "example.*"}]
ProfileColumns이 지정되면 이름이의 이름 또는 정규식과 일치하는 열만 프로파일 작업에 ProfileColumns 포함됩니다. 프로파일 작업이 선택한 열의 데이터 유형을 지원하지 않는 경우 DataBrew는 작업 실행 중에 선택한 열을 건너뜁니다.
ProfileColumns가 정의되지 않은 경우 프로파일 작업은 지원되는 모든 열을 평가합니다. 지원되는 열은 지원되는 데이터 형식인 ByteType, , , ShortType, IntegerType, LongTypeFloatType, DoubleType String또는의 데이터가 포함된 열입니다Boolean.
DatasetStatisticsConfiguration 섹션
구조의 DatasetStatisticsConfiguration 섹션에서 열 간 평가를 위한 구성을 구축할 수 있습니다. 구성에는 IncludedStatistics 및가 포함됩니다Overrides. 예를 들면 다음과 같습니다.
"DatasetStatisticsConfiguration": { "IncludedStatistics": ["CORRELATION"], "Overrides": [ { "Statistic": "CORRELATION", "Parameters": { "columnSelectors": "[{\"name\":\"example\"}, {\"regex\":\"example.*\"}]" } } ] }
에 평가 이름을 추가하여 원하는 평가를 선택할 수 있습니다IncludedStatistics. 예를 들면 다음과 같습니다.
"IncludedStatistics": ["CORRELATION", "DUPLICATE_ROWS_COUNT"]
를 지정하면 목록의 평가IncludedStatistics만 프로파일 작업에 포함됩니다. IncludedStatistics가 정의되지 않은 경우 프로파일 작업은 기본 설정으로 지원되는 모든 평가를 실행합니다. 에 NONE을 추가하여 모든 평가를 제외할 수 있습니다IncludedStatistics. 예를 들면 다음과 같습니다.
"IncludedStatistics": ["NONE"]
데이터 세트 수준에서 구성 가능한 통계
구조의 DatasetStatisticsConfiguration 섹션에서 프로필 작업은 다음 표에 표시된 평가를 지원합니다.
| 통계 이름 | 설명 | 지원되는 데이터 유형 | 기본 상태 | 프로필 결과의 속성 | 프로필 결과 유형 |
|---|---|---|---|---|---|
DUPLICATE_ROWS_COUNT |
데이터 세트의 중복 행 수 |
모두 |
Enable |
duplicateRowsCount |
정수 |
상관 관계 |
두 열 간의 Pearson 상관 계수 |
number |
Enable |
상관 관계(선택한 각 열에서) |
객체 |
에서 재정의를 추가하여 각 평가의 기본 설정을 재정의할 IncludedStatistics수 있습니다. 각 재정의에는 특정 평가의 이름과 파라미터 맵이 포함됩니다.
에서 DatasetStatisticsConfiguration프로필 작업은 CORRELATION 재정의를 지원합니다. 이 재정의는 선택한 열 목록에서 두 열 간의 Pearson 상관관계 계수를 계산합니다. 기본 설정은 처음 10개의 숫자 열을 선택하는 것입니다. 여러 열 또는 열 선택기 목록을 지정하여 기본 설정을 재정의할 수 있습니다.
CORRELATION는 다음 파라미터를 사용합니다.
columnNumber- 숫자 열 수입니다. 프로파일 작업은 데이터 세트에서 첫 번째 n개의 열을 선택합니다. 이 값은 1보다 커야 합니다."ALL"를 사용하여 모든 숫자 열을 선택합니다.columnSelectors:- 열 선택기 목록입니다. 각 선택기에는 열 이름 또는 정규식이 있을 수 있습니다.
예를 들면 다음과 같습니다.
{ "Statistic": "CORRELATION", "Parameters": { "columnSelectors": "[{\"name\":\"example\"}, {\"regex\":\"example.*\"}]" } }
ColumnStatisticsConfigurations 섹션
구조의 ColumnStatisticsConfigurations 섹션에서 특정 열에 대한 구성을 빌드할 수 있습니다. ColumnStatisticsConfigurations는 ColumnStatisticsConfiguration 설정 목록입니다. 에는 통계 구성ColumnStatisticsConfigurationSelectors에 Statistics 대한 , 열 선택기 목록 및가 있습니다. 예를 들면 다음과 같습니다.
{ "Selectors": [{"Name": "example"} ], "Statistics": { "IncludedStatistics": ["CORRELATION", "DUPLICATE_ROWS_COUNT"] "Overrides": [ { "Statistic": "VALUE_DISTRIBUTION", "Parameters": { "binNumber": "10" } } ] } }
Selectors는 열 선택기 목록입니다. 와 마찬가지로 각 열 선택기에서 열 이름 또는 정규식을 지정할 ProfileColumns수 있습니다. 를 지정하면 Selectors의 열 선택기와 일치하는 열에 열 구성이 적용됩니다Selectors. 그렇지 않으면 지원되는 모든 열에 구성이 적용됩니다.
에서 선택한 열의 설정을 재정의Statistics할 수 있습니다. 와 마찬가지로 에는 IncludedStatistics 및 DatasetStatisticsConfigurationStatistics가 있습니다Overrides.
원하는 평가를 선택하려면에 평가 이름을 추가합니다IncludedStatistics.
"IncludedStatistics": ["CORRELATION", "DUPLICATE_ROWS_COUNT"]
를 지정하면 목록의 평가IncludedStatistics만 프로파일 작업에 포함됩니다. 그렇지 않으면 프로필 작업은 기본 설정으로 지원되는 모든 평가를 실행합니다.
에를 추가하여 모든 평가를 제외NONE할 수 있습니다IncludedStatistics.
"IncludedStatistics": ["NONE"]
경우에 따라에서 동일한 열에 적용할 수 ColumnStatisticsConfigurations 있는 구성이 다를 IncludedStatistics 수 있습니다. 이러한 경우 프로파일 작업은에서 마지막 구성을 선택하고 선택한 열IncludedStatistics에 ColumnStatisticsConfigurations 적용합니다. 새 구성은 이전 구성을 재정의합니다.
열 수준에서 구성 가능한 통계
에서 ColumnStatisticsConfigurations프로필 작업은 다음 표에 표시된 평가를 지원합니다.
이 표number에서 지원되는 데이터 형식은 속성의 데이터 형식이 ByteType, , ShortType, IntegerType, LongType FloatType또는 중 하나임을 의미합니다DoubleType.
| 통계 이름 | 설명 | 지원되는 데이터 유형 | 기본 상태 | 프로필 결과의 속성 | 프로필 결과 유형 |
|---|---|---|---|---|---|
– |
열의 이름입니다. |
모두 |
– |
이름 |
문자열 |
– |
열의 데이터 유형입니다. |
모두 |
– |
type |
문자열 |
DISTINCT_VALUES_COUNT |
고유 값 수입니다. 고유한 값은 한 번 이상 나타나는 값입니다. |
number/boolean/string |
활성화됨 |
distinctValuesCount |
정수 |
엔트로피 |
엔트로피(정보 이론). |
number/boolean/string |
활성화됨 |
엔트로피 |
배정밀도 실수 |
INTER_QUARTILE_RANGE |
숫자의 25%에서 75% 사이의 범위입니다. |
number |
활성화됨 |
interquartileRange |
배정밀도 실수 |
첨도 |
열의 Kurtosis입니다. |
number |
활성화됨 |
첨도 |
배정밀도 실수 |
MAX |
열의 최대값입니다. |
숫자/문자열 길이 |
활성화됨 |
최대 |
정수/더블 |
MAXIMUM_VALUES |
열의 최대값 및 해당 개수 목록입니다. |
number |
활성화됨 |
maximumValues |
List |
MEAN |
열에 있는 값의 평균 값입니다. |
숫자/문자열 길이 |
활성화됨 |
mean |
배정밀도 실수 |
MEDIAN |
열의 값 중앙값입니다. |
숫자/문자열 길이 |
활성화됨 |
median |
배정밀도 실수 |
MEDIAN_ABSOLUTE_DEVIATION |
각 데이터 포인트 간 절대 차이의 중앙값과 숫자 열의 중앙값입니다. |
number |
활성화됨 |
medianAbsoluteDeviation |
배정밀도 실수 |
MIN |
열의 최소값입니다. |
숫자/문자열 길이 |
활성화됨 |
min |
정수/더블 |
최소_값 |
열의 최소값 및 해당 개수 목록입니다. |
number |
활성화됨 |
minimumValues |
List |
누락된_값_COUNT |
열의 누락된 값 수입니다. Null 및 빈 문자열은 누락된 것으로 간주됩니다. |
모두 |
활성화됨 |
missingValuesCount |
정수 |
MODE |
열에서 가장 자주 발생하는 값입니다. 여러 값이 자주 나타나는 경우 모드는 해당 값 중 하나입니다. |
숫자/문자열 길이 |
활성화됨 |
모드 |
정수/더블 |
MOST_COMMON_VALUES |
열에서 가장 일반적인 값의 목록입니다. |
number/boolean/string |
활성화됨 |
mostCommonValues |
List |
OUTLIER_DETECTION |
Z_score 알고리즘으로 열의 이상값을 감지합니다. 특이값 수를 계산하고 감지된 특이값에서 샘플 목록을 추출합니다. |
숫자/문자열 길이 |
활성화됨 |
zScoreOutliersCount, zScoreOutliersSample |
정수/목록 |
백분위수 |
숫자 열의 백분위수 값(5%, 25%, 75%, 95%). |
number |
활성화됨 |
백분위수5, 백분위수25, 백분위수75, 백분위수95 |
배정밀도 실수 |
RANGE |
열의 값 범위입니다. |
number |
활성화됨 |
range |
정수/더블 |
왜도 |
열에 있는 값의 왜곡입니다. |
number |
활성화됨 |
왜도 |
배정밀도 실수 |
STANDARD_DEVIATION |
열 값의 편향되지 않은 샘플 표준 편차입니다. |
숫자/문자열 길이 |
활성화됨 |
standardDeviation |
배정밀도 실수 |
SUM |
열의 값 합계입니다. |
number |
활성화됨 |
sum |
정수/더블 |
UNIQUE_VALUES_COUNT |
고유 값 수입니다. 고유한 값은 값이 한 번만 표시됨을 의미합니다. |
number/boolean/string |
활성화됨 |
uniqueValuesCount |
정수 |
VALUE_DISTRIBUTION |
범위별로 열의 값 분포를 측정합니다. |
숫자/문자열 길이 |
활성화됨 |
valueDistribution |
List |
분산 |
열의 값 차이입니다. |
number |
활성화됨 |
variance |
배정밀도 실수 |
Z_SCORE_DISTRIBUTION |
범위별 데이터 포인트의 z-점수 값 분포를 측정합니다. |
number |
활성화됨 |
zScoreDistribution |
List |
ZEROS_COUNT |
열의 0(0) 수입니다. |
number |
활성화됨 |
zerosCount |
정수 |
에서 재정의를 추가하여 각 평가의 기본 파라미터를 재정의할 IncludedStatistics수 있습니다. 각 재정의에는 특정 평가의 이름과 파라미터 맵이 포함됩니다.
ColumnStatisticsConfigurations 열에 대한 파라미터
에서 ColumnStatisticsConfigurations프로파일 작업은 다음 파라미터를 지원합니다.
경우에 따라에서 동일한 열에 적용할 수 ColumnStatisticsConfigurations 있는 구성이 다를 IncludedStatistics 수 있습니다. 이러한 경우 프로파일 작업은에서 마지막 구성을 선택하고 선택한 열IncludedStatistics에 ColumnStatisticsConfigurations 적용합니다. 새 구성은 이전 구성을 재정의합니다.
MAXIMUM_VALUES
숫자 열의 최대값과 해당 개수를 나열합니다. 기본 목록 크기는 5입니다. 에 값을 지정하여 목록 크기를 재정의할 수 있습니다sampleSize.
설정
sampleSize - 숫자 열의 최대 값 수와 개수를 포함하는 목록 크기입니다. 이 값은 0보다 커야 합니다. "ALL"를 사용하여 모든 값을 나열합니다.
예제
{ "Statistic": "MAXIMUM_VALUES", "Parameters": { "sampleSize": "5" } }
최소_값
숫자 열의 최소값과 해당 개수를 나열합니다. 기본 목록 크기는 5입니다. 에 값을 지정하여 목록 크기를 재정의할 수 있습니다sampleSize.
설정
sampleSize - 숫자 열의 최대 값 수와 개수를 포함하는 목록 크기입니다. 이 값은 0보다 커야 합니다. "ALL"를 사용하여 모든 값을 나열합니다.
예제
{ "Statistic": "MINIMUM_VALUES", "Parameters": { "sampleSize": "5" } }
MOST_COMMON_VALUES
열에서 가장 일반적인 값과 해당 수를 나열합니다. 기본 목록 크기는 50입니다. 에 값을 지정하여 목록 크기를 재정의할 수 있습니다sampleSize.
설정
sampleSize - 숫자 열의 최대 값 수와 개수를 포함하는 목록 크기입니다. 이 값은 0보다 커야 합니다. "ALL"를 사용하여 모든 값을 나열합니다.
예제
{ "Statistic": "MOST_COMMON_VALUES", "Parameters": { "sampleSize": "50" } }
OUTLIER_DETECTION
Z_score 알고리즘을 사용하여 숫자 열 또는 문자열 열(문자열 길이 기준)의 이상값을 감지합니다.
프로필 작업은 특이값 수를 계산하고 특이값 및 해당 z-점수의 샘플 목록을 생성합니다. 샘플 목록은 z점수의 절대값을 기준으로 정렬됩니다. 기본 목록 크기는 50입니다.
Z_Score 알고리즘은 평균에서 표준 편차 임계값 이상으로 벗어날 때 값을 이상값으로 식별합니다. 기본 이상값 임계값은 3입니다.
임계값, 즉 임계값을 하나 더 제공하여 자세한 정보를 얻을 수 있습니다. 최소 임계값은 임계값보다 작아야 합니다. 이 기능은 기본적으로 꺼져 있습니다. 약한 임계값이 지정되면 프로파일 작업은 개수를 하나 더 반환합니다zScoreMildOutliersCount. 또한이 경우는 약한 임계값 이상치 샘플을 포함할 zScoreOutliersSample 수 있습니다.
설정
threshold- 이상값을 감지할 때 사용할 임계값입니다. 이 값은 0보다 크거나 같아야 합니다.mildThreshold- 이상값을 감지할 때 사용할 최소 임계값입니다. 이 값은 0보다 크거나 같아야 하며 보다 작아야 합니다threshold.sampleSize- 열에 이상치를 포함하는 목록의 크기입니다."ALL"를 사용하여 모든 값을 나열합니다.
예제
{ "Statistic": "OUTLIER_DETECTION", "Parameters": { "threshold": "5", "mildThreshold": "3.5", "sampleSize": "20" } }
VALUE_DISTRIBUTION
값의 범위를 기준으로 열의 값 분포를 측정합니다. 프로필 작업은 숫자 열 또는 문자열 열(문자열 길이 기준)의 값을 숫자 범위별로 빈으로 그룹화하고 빈 목록을 생성합니다. 빈은 연속적이며 버킷의 상한은 다음 버킷의 하한입니다.
설정
binNumber - 빈 수입니다. 이 값은 0보다 커야 합니다.
예제
{ "Statistic": "VALUE_DISTRIBUTION", "Parameters": { "binNumber": "5" } }
Z_SCORE_DISTRIBUTION
숫자 열에서 값의 z-점수 분포를 측정합니다. 프로파일 작업은 값의 z-점수를 숫자 범위별로 빈으로 그룹화하고 빈 목록을 생성합니다. 빈은 연속적이며 버킷의 상한은 다음 버킷의 하한입니다.
설정
binNumber - 빈 수입니다. 이 값은 0보다 커야 합니다.
예제
{ "Statistic": "Z_SCORE_DISTRIBUTION", "Parameters": { "binNumber": "5" } }
PII 구성을 위한 EntityDetectorConfiguration 섹션
구조의 EntityDetectorConfiguration 섹션에서 DataBrew가 프로필 작업에 대한 개인 식별 정보(PII)로 감지할 데이터 세트의 엔터티 유형을 구성할 수 있습니다.
EntityTypes
DataBrew가 프로필 작업에 대한 PII로 감지할 엔터티 유형을 구성합니다. EntityDetectorConfiguration가 정의되지 않으면 개체 감지가 비활성화됩니다. 데이터 세트에서 다음 엔터티 유형을 감지할 수 있습니다.
USA_SSN
EMAIL
USA_ITIN
USA_PASSPORT_NUMBER
PHONE_NUMBER
USA_DRIVING_LICENSE
BANK_ACCOUNT
CREDIT_CARD
IP_ADDRESS
MAC_ADDRESS
USA_DEA_NUMBER
USA_HCPCS_CODE
USA_NATIONAL_PROVIDER_IDENTIFIER
USA_NATIONAL_DRUG_CODE
USA_HEALTH_INSURANCE_CLAIM_NUMBER
USA_MEDICARE_BENEFICIARY_IDENTIFIER
USA_CPT_CODE
PERSON_NAME
DATE
개체 유형 그룹USA_ALL도 지원되며 및 PERSON_NAME를 제외한 위의 모든 개체 유형을 포함합니다DATE.
의 유형은 문자열 EntityTypes 배열입니다.
AllowedStatistics
감지된 개체가 포함된 열에서 실행할 수 있는 통계를 구성합니다. AllowedStatistics가 정의되지 않은 경우 감지된 엔터티가 포함된 열에 대한 통계는 계산되지 않습니다. AllowedStatistics 파라미터의 유효한 값 목록은 열 수준에서 구성 가능한 통계 섹션을 참조하세요.
의 유형은 AllowedStatistics 객체의 배열AllowedStatistics입니다.