기계 번역으로 제공되는 번역입니다. 제공된 번역과 원본 영어의 내용이 상충하는 경우에는 영어 버전이 우선합니다.
사용 가능한 검사
다음 표에는 규칙에 사용할 수 있는 모든 사용 가능한 조건에 대한 참조가 나열되어 있습니다. 집계된 조건은 동일한 규칙에서 집계되지 않은 조건과 결합할 수 없습니다.
참고
SDK 사용자의 경우 여러 열에 동일한 규칙을 적용하려면 규칙의 ColumnSelectors 속성을 사용하고 이름 또는 정규식을 사용하여 검증된 열을 지정합니다. 이 경우 암시적 CheckExpression을 사용해야 합니다. 예를 들어, 선택한 각 열의 값을 제공된 값과 “> :val” 비교합니다. DataBrew는 동적 데이터 세트에서 FilterExpression을 정의하는 데 암시적 구문을 사용합니다. 각 검사에 대해 개별적으로 열(들)을 지정하려면 ColumnSelectors 속성을 설정하지 마십시오. 대신 명시적 표현식을 제공합니다. 규칙의 “:col > :val” CheckExpression을 예로 들 수 있습니다.
| 조건 유형 | 데이터 품질 검사 | 추가 파라미터 | 비교 유형 | SDK 구문 예제 |
|---|---|---|---|---|
| 집계 데이터 세트 조건 | 행 수 | 사용자 지정 값과 숫자 비교 |
|
|
| 열 수 | 사용자 지정 값과 숫자 비교 |
| ||
중복된 행 |
사용자 지정 값과 숫자 비교 |
또는
|
||
| 열 통계 조건 집계 | 누락된 값 | 사용자 지정 값과 숫자 비교 |
또는
|
|
| 중복 값 | 사용자 지정 값과 숫자 비교 |
또는
| ||
유효값 |
사용자 지정 값과 숫자 비교 |
또는
|
||
| 고유 값 | 사용자 지정 값과 숫자 비교 |
또는
| ||
고유 값 |
사용자 지정 값과 숫자 비교 |
또는
|
||
이상치 |
Z-점수 임계값 | 사용자 지정 값과 숫자 비교 |
또는
|
|
값 분포 통계 |
통계 이름(다음 표 참조) | 사용자 지정 값과 숫자 비교 |
또는
참고 가능한 |
|
숫자 통계 |
통계 이름(다음 표 참조) | 사용자 지정 값과 숫자 비교 |
또는
참고 가능한 |
|
| 집계되지 않음(임계값 허용) | 값은 정확히 입니다. | 값 목록과의 정확한 비교 |
|
|
| 값이 정확하지 않음 | 값이 목록의 값과 정확히 일치하지 않아야 합니다. |
| ||
| 문자열 값 | 사용자 지정 값 또는 기타 문자열 열과 문자열 비교 |
또는
| ||
| 숫자 값 | 사용자 지정 값 또는 기타 숫자 열과 숫자 비교 |
또는
| ||
| 값 문자열 길이 | 사용자 지정 값 또는 기타 숫자 열과 숫자 비교 |
또는
|
숫자 비교
DataBrew는 숫자 비교를 위해 다음 작업을 지원합니다. Is equals (==), Is not equals (!=), Less than (<), Less than equals (<=), Greater than (>), Greater than equals (>=) 및 Is between (is_between :val1 and :val2).
문자열 비교
다음 문자열 비교가 지원됩니다. 로 시작, 로 시작하지 않음, 로 종료, 로 종료하지 않음, 포함, 포함하지 않음, 같음, 같지 않음, 일치, 일치하지 않음.
다음 표에는 값 분포 통계 및 숫자 통계에 사용할 수 있는 사용 가능한 통계가 표시됩니다.
| 데이터 품질 검사 | 통계 이름 | 추가 파라미터 | SDK 구문 |
|---|---|---|---|
| 값 분포 통계 | 최소 | "CheckExpression": "AGG(MAX) < :val",
"SubstitutionMap": {":val", "100"}
|
|
| 최대 | "CheckExpression": "AGG(MIN) > :val",
"SubstitutionMap": {":val", "0"}
|
||
| Median | "CheckExpression": "AGG(MEDIAN) >= :val",
"SubstitutionMap": {":val", "50"}
|
||
| Mean | "CheckExpression": "AGG(MEAN) <= :val",
"SubstitutionMap": {":val", "10"}
|
||
| Mode | "CheckExpression": "AGG(MODE) > :val",
"SubstitutionMap": {":val", "0"}
|
||
| 표준 편차 | "CheckExpression": "AGG(STANDARD_DEVIATION) > :val",
"SubstitutionMap": {":val", "0"}
|
||
| Entropy | "CheckExpression": "AGG(ENTROPY) > :val",
"SubstitutionMap": {":val", "0"}
|
||
| 숫자 통계 | Sum | "CheckExpression": "AGG(SUM) > :val",
"SubstitutionMap": {":val", "0"}
|
|
| 쿠르트증 | "CheckExpression": "AGG(KURTOSIS) > :val",
"SubstitutionMap": {":val", "0"}
| ||
| 왜도 | "CheckExpression": "AGG(SKEWNESS) > :val",
"SubstitutionMap": {":val", "0"}
|
||
| 분산 | "CheckExpression": "AGG(VARIANCE) > :val",
"SubstitutionMap": {":val", "0"}
|
||
| 절대 편차 | "CheckExpression": "AGG(MEDIAN_ABSOLUTE_DEVIATION) > :val",
"SubstitutionMap": {":val", "0"}
|
||
| 분위수 | 분위수: '0.25', '0.5', '0.75' 중 하나 | "CheckExpression": "AGG(QUANTILE, :pct) > :val",
"SubstitutionMap": {":pct": "0.25", ":val", "0"}
|