View a markdown version of this page

에서 프로그래밍 방식으로 프로파일 작업 구성 빌드AWS Glue DataBrew - AWS Glue DataBrew개발자 안내서

기계 번역으로 제공되는 번역입니다. 제공된 번역과 원본 영어의 내용이 상충하는 경우에는 영어 버전이 우선합니다.

에서 프로그래밍 방식으로 프로파일 작업 구성 빌드AWS Glue DataBrew

이 섹션에서는 프로그래밍 방식으로 사용할 수 있는 프로필 작업 단계 및 함수에 대한 설명을 찾을 수 있습니다.AWS Command Line Interface(AWS CLI)에서 또는AWS SDKs.

프로필 작업에서 구성을 사용자 지정하여 DataBrew가 데이터 세트를 평가하는 방법을 제어할 수 있습니다. 구성을 데이터 세트에 적용하거나 특정 열에 적용할 수 있습니다. 프로필 작업을 생성할 때 구성을 빌드한 다음 언제든지 업데이트할 수 있습니다.

프로필 구성 구조는 네 부분으로 구성됩니다.

다음은 한 예입니다.

{ "ProfileColumns": [ { "Name": "example" }, { "Regex": "example.*" } ], "DatasetStatisticsConfiguration": { "IncludedStatistics": [ "CORRELATION" ], "Overrides": [ { "Statistic": "CORRELATION", "Parameters": { "columnSelectors": "[{\"name\":\"example\"}, {\"regex\":\"example.*\"}]" } } ] }, "ColumnStatisticsConfigurations": [ { "Selectors": [ { "Name": "example" } ], "Statistics": { "IncludedStatistics": [ "CORRELATION", "DUPLICATE_ROWS_COUNT" ], "Overrides": [ { "Statistic": "VALUE_DISTRIBUTION", "Parameters": { "binNumber": "10" } } ] } } ] }

ProfileColumns 섹션

구조의 ProfileColumns 섹션에서 프로필 작업에서 평가하려는 데이터 세트의 열을 설정합니다. ProfileColumns는 열 선택기 목록(Selectors)입니다. 열 선택기에서 열 이름 또는 정규식을 지정할 수 있습니다. 예를 들면 다음과 같습니다.

"ProfileColumns": [{"Name": "example"}, {"Regex": "example.*"}]

ProfileColumns이 지정되면 이름이의 이름 또는 정규식과 일치하는 열만 프로파일 작업에 ProfileColumns 포함됩니다. 프로파일 작업이 선택한 열의 데이터 유형을 지원하지 않는 경우 DataBrew는 작업 실행 중에 선택한 열을 건너뜁니다.

ProfileColumns가 정의되지 않은 경우 프로파일 작업은 지원되는 모든 열을 평가합니다. 지원되는 열은 지원되는 데이터 형식인 ByteType, , , ShortType, IntegerType, LongTypeFloatType, DoubleType String또는의 데이터가 포함된 열입니다Boolean.

DatasetStatisticsConfiguration 섹션

구조의 DatasetStatisticsConfiguration 섹션에서 열 간 평가를 위한 구성을 구축할 수 있습니다. 구성에는 IncludedStatistics 및가 포함됩니다Overrides. 예를 들면 다음과 같습니다.

"DatasetStatisticsConfiguration": { "IncludedStatistics": ["CORRELATION"], "Overrides": [ { "Statistic": "CORRELATION", "Parameters": { "columnSelectors": "[{\"name\":\"example\"}, {\"regex\":\"example.*\"}]" } } ] }

에 평가 이름을 추가하여 원하는 평가를 선택할 수 있습니다IncludedStatistics. 예를 들면 다음과 같습니다.

"IncludedStatistics": ["CORRELATION", "DUPLICATE_ROWS_COUNT"]

를 지정하면 목록의 평가IncludedStatistics만 프로파일 작업에 포함됩니다. IncludedStatistics가 정의되지 않은 경우 프로파일 작업은 기본 설정으로 지원되는 모든 평가를 실행합니다. 에 NONE을 추가하여 모든 평가를 제외할 수 있습니다IncludedStatistics. 예를 들면 다음과 같습니다.

"IncludedStatistics": ["NONE"]

데이터 세트 수준에서 구성 가능한 통계

구조의 DatasetStatisticsConfiguration 섹션에서 프로필 작업은 다음 표에 표시된 평가를 지원합니다.

통계 이름 설명 지원되는 데이터 유형 기본 상태 프로필 결과의 속성 프로필 결과 유형

DUPLICATE_ROWS_COUNT

데이터 세트의 중복 행 수

모두

Enable

duplicateRowsCount

정수

상관 관계

두 열 간의 Pearson 상관 계수

number

Enable

상관 관계(선택한 각 열에서)

객체

에서 재정의를 추가하여 각 평가의 기본 설정을 재정의할 IncludedStatistics수 있습니다. 각 재정의에는 특정 평가의 이름과 파라미터 맵이 포함됩니다.

에서 DatasetStatisticsConfiguration프로필 작업은 CORRELATION 재정의를 지원합니다. 이 재정의는 선택한 열 목록에서 두 열 간의 Pearson 상관관계 계수를 계산합니다. 기본 설정은 처음 10개의 숫자 열을 선택하는 것입니다. 여러 열 또는 열 선택기 목록을 지정하여 기본 설정을 재정의할 수 있습니다.

CORRELATION는 다음 파라미터를 사용합니다.

  • columnNumber - 숫자 열 수입니다. 프로파일 작업은 데이터 세트에서 첫 번째 n개의 열을 선택합니다. 이 값은 1보다 커야 합니다. "ALL"를 사용하여 모든 숫자 열을 선택합니다.

  • columnSelectors: - 열 선택기 목록입니다. 각 선택기에는 열 이름 또는 정규식이 있을 수 있습니다.

예를 들면 다음과 같습니다.

{ "Statistic": "CORRELATION", "Parameters": { "columnSelectors": "[{\"name\":\"example\"}, {\"regex\":\"example.*\"}]" } }

ColumnStatisticsConfigurations 섹션

구조의 ColumnStatisticsConfigurations 섹션에서 특정 열에 대한 구성을 빌드할 수 있습니다. ColumnStatisticsConfigurationsColumnStatisticsConfiguration 설정 목록입니다. 에는 통계 구성ColumnStatisticsConfigurationSelectorsStatistics 대한 , 열 선택기 목록 및가 있습니다. 예를 들면 다음과 같습니다.

{ "Selectors": [{"Name": "example"} ], "Statistics": { "IncludedStatistics": ["CORRELATION", "DUPLICATE_ROWS_COUNT"] "Overrides": [ { "Statistic": "VALUE_DISTRIBUTION", "Parameters": { "binNumber": "10" } } ] } }

Selectors는 열 선택기 목록입니다. 와 마찬가지로 각 열 선택기에서 열 이름 또는 정규식을 지정할 ProfileColumns수 있습니다. 를 지정하면 Selectors의 열 선택기와 일치하는 열에 열 구성이 적용됩니다Selectors. 그렇지 않으면 지원되는 모든 열에 구성이 적용됩니다.

에서 선택한 열의 설정을 재정의Statistics할 수 있습니다. 와 마찬가지로 에는 IncludedStatisticsDatasetStatisticsConfigurationStatistics가 있습니다Overrides.

원하는 평가를 선택하려면에 평가 이름을 추가합니다IncludedStatistics.

"IncludedStatistics": ["CORRELATION", "DUPLICATE_ROWS_COUNT"]

를 지정하면 목록의 평가IncludedStatistics만 프로파일 작업에 포함됩니다. 그렇지 않으면 프로필 작업은 기본 설정으로 지원되는 모든 평가를 실행합니다.

에를 추가하여 모든 평가를 제외NONE할 수 있습니다IncludedStatistics.

"IncludedStatistics": ["NONE"]

경우에 따라에서 동일한 열에 적용할 수 ColumnStatisticsConfigurations 있는 구성이 다를 IncludedStatistics 수 있습니다. 이러한 경우 프로파일 작업은에서 마지막 구성을 선택하고 선택한 열IncludedStatisticsColumnStatisticsConfigurations 적용합니다. 새 구성은 이전 구성을 재정의합니다.

열 수준에서 구성 가능한 통계

에서 ColumnStatisticsConfigurations프로필 작업은 다음 표에 표시된 평가를 지원합니다.

이 표number에서 지원되는 데이터 형식은 속성의 데이터 형식이 ByteType, , ShortType, IntegerType, LongType FloatType또는 중 하나임을 의미합니다DoubleType.

통계 이름 설명 지원되는 데이터 유형 기본 상태 프로필 결과의 속성 프로필 결과 유형

열의 이름입니다.

모두

이름

문자열

열의 데이터 유형입니다.

모두

type

문자열

DISTINCT_VALUES_COUNT

고유 값 수입니다. 고유한 값은 한 번 이상 나타나는 값입니다.

number/boolean/string

활성화됨

distinctValuesCount

정수

엔트로피

엔트로피(정보 이론).

number/boolean/string

활성화됨

엔트로피

배정밀도 실수

INTER_QUARTILE_RANGE

숫자의 25%에서 75% 사이의 범위입니다.

number

활성화됨

interquartileRange

배정밀도 실수

첨도

열의 Kurtosis입니다.

number

활성화됨

첨도

배정밀도 실수

MAX

열의 최대값입니다.

숫자/문자열 길이

활성화됨

최대

정수/더블

MAXIMUM_VALUES

열의 최대값 및 해당 개수 목록입니다.

number

활성화됨

maximumValues

List

MEAN

열에 있는 값의 평균 값입니다.

숫자/문자열 길이

활성화됨

mean

배정밀도 실수

MEDIAN

열의 값 중앙값입니다.

숫자/문자열 길이

활성화됨

median

배정밀도 실수

MEDIAN_ABSOLUTE_DEVIATION

각 데이터 포인트 간 절대 차이의 중앙값과 숫자 열의 중앙값입니다.

number

활성화됨

medianAbsoluteDeviation

배정밀도 실수

MIN

열의 최소값입니다.

숫자/문자열 길이

활성화됨

min

정수/더블

최소_값

열의 최소값 및 해당 개수 목록입니다.

number

활성화됨

minimumValues

List

누락된_값_COUNT

열의 누락된 값 수입니다. Null 및 빈 문자열은 누락된 것으로 간주됩니다.

모두

활성화됨

missingValuesCount

정수

MODE

열에서 가장 자주 발생하는 값입니다. 여러 값이 자주 나타나는 경우 모드는 해당 값 중 하나입니다.

숫자/문자열 길이

활성화됨

모드

정수/더블

MOST_COMMON_VALUES

열에서 가장 일반적인 값의 목록입니다.

number/boolean/string

활성화됨

mostCommonValues

List

OUTLIER_DETECTION

Z_score 알고리즘으로 열의 이상값을 감지합니다. 특이값 수를 계산하고 감지된 특이값에서 샘플 목록을 추출합니다.

숫자/문자열 길이

활성화됨

zScoreOutliersCount, zScoreOutliersSample

정수/목록

백분위수

숫자 열의 백분위수 값(5%, 25%, 75%, 95%).

number

활성화됨

백분위수5, 백분위수25, 백분위수75, 백분위수95

배정밀도 실수

RANGE

열의 값 범위입니다.

number

활성화됨

range

정수/더블

왜도

열에 있는 값의 왜곡입니다.

number

활성화됨

왜도

배정밀도 실수

STANDARD_DEVIATION

열 값의 편향되지 않은 샘플 표준 편차입니다.

숫자/문자열 길이

활성화됨

standardDeviation

배정밀도 실수

SUM

열의 값 합계입니다.

number

활성화됨

sum

정수/더블

UNIQUE_VALUES_COUNT

고유 값 수입니다. 고유한 값은 값이 한 번만 표시됨을 의미합니다.

number/boolean/string

활성화됨

uniqueValuesCount

정수

VALUE_DISTRIBUTION

범위별로 열의 값 분포를 측정합니다.

숫자/문자열 길이

활성화됨

valueDistribution

List

분산

열의 값 차이입니다.

number

활성화됨

variance

배정밀도 실수

Z_SCORE_DISTRIBUTION

범위별 데이터 포인트의 z-점수 값 분포를 측정합니다.

number

활성화됨

zScoreDistribution

List

ZEROS_COUNT

열의 0(0) 수입니다.

number

활성화됨

zerosCount

정수

에서 재정의를 추가하여 각 평가의 기본 파라미터를 재정의할 IncludedStatistics수 있습니다. 각 재정의에는 특정 평가의 이름과 파라미터 맵이 포함됩니다.

ColumnStatisticsConfigurations 열에 대한 파라미터

에서 ColumnStatisticsConfigurations프로파일 작업은 다음 파라미터를 지원합니다.

경우에 따라에서 동일한 열에 적용할 수 ColumnStatisticsConfigurations 있는 구성이 다를 IncludedStatistics 수 있습니다. 이러한 경우 프로파일 작업은에서 마지막 구성을 선택하고 선택한 열IncludedStatisticsColumnStatisticsConfigurations 적용합니다. 새 구성은 이전 구성을 재정의합니다.

MAXIMUM_VALUES

숫자 열의 최대값과 해당 개수를 나열합니다. 기본 목록 크기는 5입니다. 에 값을 지정하여 목록 크기를 재정의할 수 있습니다sampleSize.

설정

sampleSize - 숫자 열의 최대 값 수와 개수를 포함하는 목록 크기입니다. 이 값은 0보다 커야 합니다. "ALL"를 사용하여 모든 값을 나열합니다.

예제

{ "Statistic": "MAXIMUM_VALUES", "Parameters": { "sampleSize": "5" } }

최소_값

숫자 열의 최소값과 해당 개수를 나열합니다. 기본 목록 크기는 5입니다. 에 값을 지정하여 목록 크기를 재정의할 수 있습니다sampleSize.

설정

sampleSize - 숫자 열의 최대 값 수와 개수를 포함하는 목록 크기입니다. 이 값은 0보다 커야 합니다. "ALL"를 사용하여 모든 값을 나열합니다.

예제

{ "Statistic": "MINIMUM_VALUES", "Parameters": { "sampleSize": "5" } }

MOST_COMMON_VALUES

열에서 가장 일반적인 값과 해당 수를 나열합니다. 기본 목록 크기는 50입니다. 에 값을 지정하여 목록 크기를 재정의할 수 있습니다sampleSize.

설정

sampleSize - 숫자 열의 최대 값 수와 개수를 포함하는 목록 크기입니다. 이 값은 0보다 커야 합니다. "ALL"를 사용하여 모든 값을 나열합니다.

예제

{ "Statistic": "MOST_COMMON_VALUES", "Parameters": { "sampleSize": "50" } }

OUTLIER_DETECTION

Z_score 알고리즘을 사용하여 숫자 열 또는 문자열 열(문자열 길이 기준)의 이상값을 감지합니다.

프로필 작업은 특이값 수를 계산하고 특이값 및 해당 z-점수의 샘플 목록을 생성합니다. 샘플 목록은 z점수의 절대값을 기준으로 정렬됩니다. 기본 목록 크기는 50입니다.

Z_Score 알고리즘은 평균에서 표준 편차 임계값 이상으로 벗어날 때 값을 이상값으로 식별합니다. 기본 이상값 임계값은 3입니다.

임계값, 즉 임계값을 하나 더 제공하여 자세한 정보를 얻을 수 있습니다. 최소 임계값은 임계값보다 작아야 합니다. 이 기능은 기본적으로 꺼져 있습니다. 약한 임계값이 지정되면 프로파일 작업은 개수를 하나 더 반환합니다zScoreMildOutliersCount. 또한이 경우는 약한 임계값 이상치 샘플을 포함할 zScoreOutliersSample 수 있습니다.

설정

  • threshold - 이상값을 감지할 때 사용할 임계값입니다. 이 값은 0보다 크거나 같아야 합니다.

  • mildThreshold - 이상값을 감지할 때 사용할 최소 임계값입니다. 이 값은 0보다 크거나 같아야 하며 보다 작아야 합니다threshold.

  • sampleSize - 열에 이상치를 포함하는 목록의 크기입니다. "ALL"를 사용하여 모든 값을 나열합니다.

예제

{ "Statistic": "OUTLIER_DETECTION", "Parameters": { "threshold": "5", "mildThreshold": "3.5", "sampleSize": "20" } }

VALUE_DISTRIBUTION

값의 범위를 기준으로 열의 값 분포를 측정합니다. 프로필 작업은 숫자 열 또는 문자열 열(문자열 길이 기준)의 값을 숫자 범위별로 빈으로 그룹화하고 빈 목록을 생성합니다. 빈은 연속적이며 버킷의 상한은 다음 버킷의 하한입니다.

설정

binNumber - 빈 수입니다. 이 값은 0보다 커야 합니다.

예제

{ "Statistic": "VALUE_DISTRIBUTION", "Parameters": { "binNumber": "5" } }

Z_SCORE_DISTRIBUTION

숫자 열에서 값의 z-점수 분포를 측정합니다. 프로파일 작업은 값의 z-점수를 숫자 범위별로 빈으로 그룹화하고 빈 목록을 생성합니다. 빈은 연속적이며 버킷의 상한은 다음 버킷의 하한입니다.

설정

binNumber - 빈 수입니다. 이 값은 0보다 커야 합니다.

예제

{ "Statistic": "Z_SCORE_DISTRIBUTION", "Parameters": { "binNumber": "5" } }

PII 구성을 위한 EntityDetectorConfiguration 섹션

구조의 EntityDetectorConfiguration 섹션에서 DataBrew가 프로필 작업에 대한 개인 식별 정보(PII)로 감지할 데이터 세트의 엔터티 유형을 구성할 수 있습니다.

EntityTypes

DataBrew가 프로필 작업에 대한 PII로 감지할 엔터티 유형을 구성합니다. EntityDetectorConfiguration가 정의되지 않으면 개체 감지가 비활성화됩니다. 데이터 세트에서 다음 엔터티 유형을 감지할 수 있습니다.

  • USA_SSN

  • EMAIL

  • USA_ITIN

  • USA_PASSPORT_NUMBER

  • PHONE_NUMBER

  • USA_DRIVING_LICENSE

  • BANK_ACCOUNT

  • CREDIT_CARD

  • IP_ADDRESS

  • MAC_ADDRESS

  • USA_DEA_NUMBER

  • USA_HCPCS_CODE

  • USA_NATIONAL_PROVIDER_IDENTIFIER

  • USA_NATIONAL_DRUG_CODE

  • USA_HEALTH_INSURANCE_CLAIM_NUMBER

  • USA_MEDICARE_BENEFICIARY_IDENTIFIER

  • USA_CPT_CODE

  • PERSON_NAME

  • DATE

개체 유형 그룹USA_ALL도 지원되며 및 PERSON_NAME를 제외한 위의 모든 개체 유형을 포함합니다DATE.

의 유형은 문자열 EntityTypes 배열입니다.

AllowedStatistics

감지된 개체가 포함된 열에서 실행할 수 있는 통계를 구성합니다. AllowedStatistics가 정의되지 않은 경우 감지된 엔터티가 포함된 열에 대한 통계는 계산되지 않습니다. AllowedStatistics 파라미터의 유효한 값 목록은 열 수준에서 구성 가능한 통계 섹션을 참조하세요.

의 유형은 AllowedStatistics 객체의 배열AllowedStatistics입니다.