Die vorliegende Übersetzung wurde maschinell erstellt. Im Falle eines Konflikts oder eines Widerspruchs zwischen dieser übersetzten Fassung und der englischen Fassung (einschließlich infolge von Verzögerungen bei der Übersetzung) ist die englische Fassung maßgeblich.
Erstellen und Arbeiten mit AWS Glue DataBrew Jobs profilieren
Profiljobs führen eine Reihe von Bewertungen für einen Datensatz durch und geben die Ergebnisse in Amazon S3 aus. Die Informationen, die bei der Datenprofilerstellung gesammelt werden, helfen Ihnen dabei, Ihren Datensatz zu verstehen und zu entscheiden, welche Schritte zur Datenvorbereitung Sie möglicherweise in Ihren Rezepturjobs ausführen möchten.
Die einfachste Methode, einen Profiljob auszuführen, ist die Verwendung der Standardeinstellungen DataBrew . Sie können Ihren Profiljob vor der Ausführung so konfigurieren, dass er nur die gewünschten Informationen zurückgibt.
Gehen Sie wie folgt vor, um einen DataBrew Profiljob zu erstellen.
Um einen Profiljob zu erstellen
Melden Sie sich bei der an AWS-Managementkonsole und öffnen Sie die DataBrew Konsole unter https://console.aws.amazon.com/databrew/
. Wählen Sie im Navigationsbereich die Option JOBS aus, wählen Sie die Registerkarte Profiljobs und dann Job erstellen aus.
-
Geben Sie einen Namen für Ihren Job ein und wählen Sie dann Einen Profiljob erstellen aus.
Geben Sie für die Jobeingabe den Namen des Datensatzes an, für den ein Profil erstellt werden soll.
(Optional) Konfigurieren Sie im Bereich Datenprofilkonfigurationen Folgendes:
-
Konfigurationen auf Datensatzebene — Konfigurieren Sie die Details Ihres Profiljobs für alle Spalten in Ihrem Datensatz.
Optional können Sie die Funktion aktivieren, doppelte Zeilen im Datensatz zu erkennen und zu zählen. Sie können auch Korrelationsmatrix aktivieren und Spalten auswählen, um zu sehen, wie eng die Werte in mehreren Spalten miteinander verknüpft sind. Einzelheiten zu den Statistiken, die Sie auf Datensatzebene konfigurieren können, finden Sie unterKonfigurierbare Statistiken auf Datensatzebene. Sie können Statistiken auf der DataBrew Konsole oder mithilfe der DataBrew API oder der AWS SDKs konfigurieren.
-
Konfigurationen auf Spaltenebene — Mithilfe der Standardeinstellungen für die Profilkonfiguration können Sie die Spalten auswählen, die in Ihren Profiljob aufgenommen werden sollen. Verwenden Sie „Konfigurationsüberschreibung hinzufügen“, um die Spalten auszuwählen, für die die Anzahl der gesammelten Statistiken begrenzt werden soll, oder um die Standardkonfiguration bestimmter Statistiken zu überschreiben. Einzelheiten zu den Statistiken, die Sie auf Spaltenebene konfigurieren können, finden Sie unterKonfigurierbare Statistiken auf Spaltenebene. Sie können Statistiken auf der DataBrew Konsole oder mithilfe der DataBrew API oder der AWS SDKs konfigurieren.
Stellen Sie sicher, dass alle von Ihnen angegebenen Konfigurationsüberschreibungen für Spalten gelten, die Sie in Ihren Profiljob aufgenommen haben. Wenn es Konflikte zwischen verschiedenen Überschreibungen gibt, die Sie für eine Spalte konfiguriert haben, hat die letzte widersprüchliche Überschreibung Priorität.
-
(Optional) Sie können Datenqualitätsregeln erstellen und zusätzliche Regelsätze für diesen Datensatz anwenden oder bereits angewendete Regeln entfernen. Weitere Informationen zur Überprüfung der Datenqualität finden Sie unter. Validierung der Datenqualität in AWS Glue DataBrew
-
Im Bereich Erweiterte Auftragseinstellungen können Sie weitere Optionen für die Ausführung Ihres Jobs auswählen:
-
Maximale Anzahl von Einheiten — DataBrew verarbeitet Jobs unter Verwendung mehrerer Rechenknoten, die parallel ausgeführt werden. Die Standardanzahl von Knoten ist 5. Die maximale Anzahl von Knoten ist 149.
-
Job-Timeout — Wenn die Ausführung eines Jobs länger als die von Ihnen hier festgelegte Anzahl von Minuten dauert, schlägt er mit einem Timeout-Fehler fehl. Der Standardwert ist 2.880 Minuten oder 48 Stunden.
-
Anzahl der Wiederholungen — Wenn ein Job während der Ausführung fehlschlägt, DataBrew kann versucht werden, ihn erneut auszuführen. Standardmäßig wird der Job nicht erneut versucht.
-
Amazon CloudWatch Logs für Job aktivieren — Ermöglicht DataBrew die Veröffentlichung von Diagnoseinformationen in CloudWatch Logs. Diese Protokolle können zur Fehlerbehebung oder für weitere Informationen zur Verarbeitung des Jobs nützlich sein.
-
-
Für Associated Schedule können Sie einen DataBrew Job-Zeitplan anwenden, sodass Ihr Job zu einem bestimmten Zeitpunkt oder in regelmäßigen Abständen ausgeführt wird. Weitere Informationen finden Sie unter Automatisieren von Jobläufen mit einem Zeitplan.
-
Wenn die Einstellungen Ihren Wünschen entsprechen, wählen Sie Job erstellen. Oder, wenn Sie den Job sofort ausführen möchten, wählen Sie Job erstellen und ausführen.