Die vorliegende Übersetzung wurde maschinell erstellt. Im Falle eines Konflikts oder eines Widerspruchs zwischen dieser übersetzten Fassung und der englischen Fassung (einschließlich infolge von Verzögerungen bei der Übersetzung) ist die englische Fassung maßgeblich.
Verfügbare Schecks
In der folgenden Tabelle sind Verweise auf alle verfügbaren Bedingungen aufgeführt, die in Ihren Regeln verwendet werden können. Beachten Sie, dass aggregierte Bedingungen nicht mit nicht aggregierten Bedingungen in derselben Regel kombiniert werden können.
Anmerkung
Wenn SDK-Benutzer dieselbe Regel auf mehrere Spalten anwenden möchten, verwenden Sie das ColumnSelectorsAttribut einer Regel und geben Sie validierte Spalten entweder mit ihren Namen oder einem regulären Ausdruck an. In diesem Fall sollten Sie implizit CheckExpressionverwenden. Zum Beispiel, “> :val” um Werte in jeder der ausgewählten Spalten mit dem angegebenen Wert zu vergleichen. DataBrew verwendet implizite Syntax für die Definition FilterExpressionin dynamischen Datensätzen. Wenn Sie Spalte (n) für jede Prüfung einzeln angeben möchten, legen Sie das ColumnSelectorsAttribut nicht fest. Geben Sie stattdessen einen expliziten Ausdruck an. Zum Beispiel “:col > :val” als CheckExpressionin einer Regel.
| Bedingungstyp | Überprüfung der Datenqualität | Zusätzliche Parameter | Vergleichstyp | Beispiel für eine SDK-Syntax |
|---|---|---|---|---|
| Aggregieren Sie die Bedingungen für Datensätze | Anzahl der Zeilen | Numerischer Vergleich mit benutzerdefiniertem Wert |
|
|
| Anzahl der Spalten | Numerischer Vergleich mit benutzerdefiniertem Wert |
| ||
Doppelte Zeilen |
Numerischer Vergleich mit benutzerdefiniertem Wert |
oder
|
||
| Aggregieren Sie die Bedingungen für Spaltenstatistiken | Fehlende Werte | Numerischer Vergleich mit benutzerdefiniertem Wert |
oder
|
|
| Doppelte Werte | Numerischer Vergleich mit benutzerdefinierten Werten |
oder
| ||
Zulässige Werte |
Numerischer Vergleich mit benutzerdefiniertem Wert |
oder
|
||
| Eindeutige Werte | Numerischer Vergleich mit benutzerdefinierten Werten |
oder
| ||
Eindeutige Werte |
Numerischer Vergleich mit benutzerdefinierten Werten |
oder
|
||
Ausreißer |
Z-score Schwellenwert | Numerischer Vergleich mit benutzerdefiniertem Wert |
oder
|
|
Statistik der Wertverteilung |
Name der Statistik (siehe nächste Tabelle) | Numerischer Vergleich mit benutzerdefiniertem Wert |
oder
Anmerkung Mögliche |
|
Numerische Statistik |
Name der Statistik (siehe nächste Tabelle) | Numerischer Vergleich mit benutzerdefiniertem Wert |
oder
Anmerkung Mögliche |
|
| Nicht aggregiert (akzeptiert Schwellenwert) | Der Wert ist genau | Exakter Vergleich mit einer Werteliste |
|
|
| Der Wert ist nicht exakt | Der Wert sollte nicht exakt mit einem Wert aus einer Liste übereinstimmen |
| ||
| Zeichenfolgenwerte | Vergleich einer Zeichenfolge mit einem benutzerdefinierten Wert oder einer anderen Zeichenfolgenspalte |
oder
| ||
| Numerische Werte | Numerischer Vergleich mit einem benutzerdefinierten Wert oder einer anderen numerischen Spalte |
oder
| ||
| Länge der Wertzeichenfolge | Numerischer Vergleich mit einem benutzerdefinierten Wert oder einer anderen numerischen Spalte |
oder
|
Numerische Vergleiche
DataBrew unterstützt die folgenden Operationen für numerische Vergleiche: Ist gleich (= =), Ist nicht gleich (! =), Kleiner als (<), Weniger als gleich (< =), Größer als (>), Größer als gleich (> =) und Liegt zwischen (is_between: val1 und:val2).
Vergleiche von Zeichenketten
Die folgenden Zeichenfolgenvergleiche werden unterstützt: Beginnt mit, Beginnt nicht mit, Endet mit, Endet nicht mit, Enthält, enthält nicht, Ist gleich, Ist nicht gleich, Stimmt überein, Stimmt nicht überein.
In der folgenden Tabelle werden verfügbare Statistiken angezeigt, die Sie für Wertverteilungsstatistiken und numerische Statistiken verwenden können:
| Überprüfung der Datenqualität | Name der Statistik | Zusätzliche Parameter | SDK-Syntax |
|---|---|---|---|
| Statistiken zur Wertverteilung | Min | "CheckExpression": "AGG(MAX) < :val",
"SubstitutionMap": {":val", "100"}
|
|
| Max | "CheckExpression": "AGG(MIN) > :val",
"SubstitutionMap": {":val", "0"}
|
||
| Median | "CheckExpression": "AGG(MEDIAN) >= :val",
"SubstitutionMap": {":val", "50"}
|
||
| Mean | "CheckExpression": "AGG(MEAN) <= :val",
"SubstitutionMap": {":val", "10"}
|
||
| Mode | "CheckExpression": "AGG(MODE) > :val",
"SubstitutionMap": {":val", "0"}
|
||
| Standardabweichung | "CheckExpression": "AGG(STANDARD_DEVIATION) > :val",
"SubstitutionMap": {":val", "0"}
|
||
| Entropie | "CheckExpression": "AGG(ENTROPY) > :val",
"SubstitutionMap": {":val", "0"}
|
||
| Numerische Statistik | Summe | "CheckExpression": "AGG(SUM) > :val",
"SubstitutionMap": {":val", "0"}
|
|
| Kurtosis | "CheckExpression": "AGG(KURTOSIS) > :val",
"SubstitutionMap": {":val", "0"}
| ||
| Schiefheit | "CheckExpression": "AGG(SKEWNESS) > :val",
"SubstitutionMap": {":val", "0"}
|
||
| Varianz | "CheckExpression": "AGG(VARIANCE) > :val",
"SubstitutionMap": {":val", "0"}
|
||
| Absolute Abweichung | "CheckExpression": "AGG(MEDIAN_ABSOLUTE_DEVIATION) > :val",
"SubstitutionMap": {":val", "0"}
|
||
| Quantil | Quantil: eins von '0,25', '0,5', '0,75' | "CheckExpression": "AGG(QUANTILE, :pct) > :val",
"SubstitutionMap": {":pct": "0.25", ":val", "0"}
|