Die vorliegende Übersetzung wurde maschinell erstellt. Im Falle eines Konflikts oder eines Widerspruchs zwischen dieser übersetzten Fassung und der englischen Fassung (einschließlich infolge von Verzögerungen bei der Übersetzung) ist die englische Fassung maßgeblich.
Erstellen und Arbeiten mit AWS Glue DataBrew Rezeptjobs
Verwenden Sie einen DataBrew Rezeptjob, um die Daten in einem DataBrew Datensatz zu bereinigen und zu normalisieren und das Ergebnis an einen Ausgabeort Ihrer Wahl zu schreiben. Die Ausführung eines Rezeptjobs hat keine Auswirkungen auf den Datensatz oder die zugrunde liegenden Quelldaten. Wenn ein Job ausgeführt wird, stellt er schreibgeschützt eine Verbindung zu den Quelldaten her. Die Jobausgabe wird in einen Ausgabespeicherort geschrieben, den Sie in Amazon S3 AWS Glue Data Catalog, der oder einer unterstützten JDBC-Datenbank definieren.
Gehen Sie wie folgt vor, um einen DataBrew Rezeptjob zu erstellen.
Um einen Rezeptjob zu erstellen
Melden Sie sich bei der an AWS-Managementkonsole und öffnen Sie die DataBrew Konsole unter https://console.aws.amazon.com/databrew/
. Wählen Sie im Navigationsbereich die Option JOBS aus, wählen Sie die Registerkarte Rezepturaufträge und dann Job erstellen aus.
-
Geben Sie einen Namen für Ihren Job ein und wählen Sie dann Create a recipe job aus.
-
Geben Sie unter Job-Eingabe Details zu dem Job ein, den Sie erstellen möchten: den Namen des zu verarbeitenden Datensatzes und das zu verwendende Rezept.
Ein Rezeptjob verwendet ein DataBrew Rezept, um einen Datensatz zu transformieren. Um ein Rezept zu verwenden, stellen Sie sicher, dass Sie es zuerst veröffentlichen.
-
Konfigurieren Sie Ihre Einstellungen für die Jobausgabe.
Geben Sie ein Ziel für Ihre Jobausgabe an. Wenn Sie keine DataBrew Verbindung für Ihr Ausgabeziel konfiguriert haben, konfigurieren Sie diese zunächst auf der Registerkarte DATENSÄTZE, wie unter beschriebenUnterstützte Verbindungen für Datenquellen und Ausgaben. Wählen Sie eines der folgenden Ausgabeziele:
Amazon S3, mit oder ohne AWS Glue Data Catalog Unterstützung
Amazon Redshift, mit oder ohne Unterstützung AWS Glue Data Catalog
JDBC
Snowflake-Tabellen
Amazon RDS-Datenbanktabellen mit AWS Glue Data Catalog Unterstützung. Amazon RDS-Datenbanktabellen unterstützen die folgenden Datenbank-Engines:
Amazon Aurora
MySQL
Oracle
PostgreSQL
Microsoft SQL Server
Amazon S3 mit AWS Glue Data Catalog Unterstützung.
DataBrew Unterstützt bei der AWS Glue Data CatalogAWS Lake Formation Ausgabe nur das Ersetzen vorhandener Dateien. Bei diesem Ansatz werden die Dateien ersetzt, um Ihre bestehenden Lake Formation Formation-Berechtigungen für Ihre Datenzugriffsrolle beizubehalten. Außerdem hat der Amazon S3 S3-Standort aus der DataBrew AWS Glue Data Catalog Tabelle Vorrang. Daher können Sie den Amazon S3 S3-Speicherort nicht überschreiben, wenn Sie einen Rezeptjob erstellen.
In einigen Fällen unterscheidet sich der Amazon S3 S3-Speicherort in der Jobausgabe vom Amazon S3 S3-Speicherort in der Datenkatalogtabelle. In diesen Fällen DataBrew aktualisiert die Auftragsdefinition automatisch mit dem Amazon S3 S3-Standort aus der Katalogtabelle. Dies geschieht, wenn Sie Ihre vorhandenen Jobs aktualisieren oder starten.
-
Nur für Amazon S3 S3-Ausgabeziele haben Sie weitere Auswahlmöglichkeiten:
-
Wählen Sie eines der verfügbaren Datenausgabeformate für Amazon S3, optionale Komprimierung und ein optionales benutzerdefiniertes Trennzeichen. Die unterstützten Trennzeichen für Ausgabedateien sind dieselben wie für die Eingabe: Komma, Doppelpunkt, Semikolon, senkrechter Strich, Tabulator, Caret, umgekehrter Schrägstrich und Leerzeichen. Einzelheiten zur Formatierung finden Sie in der folgenden Tabelle.
Format Dateierweiterung (unkomprimiert) Dateierweiterungen (komprimiert) Comma-separated Werte
.csv.csv.snappy,.csv.gz,.csv.lz4,csv.bz2,.csv.deflate,csv.brTab-separated Werte
.csv.tsv.snappy,.tsv.gz,.tsv.lz4,tsv.bz2,.tsv.deflate,tsv.brApache Parquet .parquet.parquet.snappy,.parquet.gz,.parquet.lz4,.parquet.lzo,.parquet.brAWS Glue Parkett Nicht unterstützt .glue.parquet.snappyApache Avro .avro.avro.snappy,.avro.gz,.avro.lz4,.avro.bz2,.avro.deflate,.avro.brApache ORC .orc.orc.snappy,.orc.lzo,.orc.zlibXML .xml.xml.snappy,.xml.gz,.xml.lz4,.xml.bz2,.xml.deflate,.xml.brJSON (nur JSON-Zeilenformat) .json.json.snappy,.json.gz,.json.lz4,json.bz2,.json.deflate,.json.brHyper Tableau Nicht unterstützt Nicht zutreffend -
Wählen Sie aus, ob eine einzelne Datei oder mehrere Dateien ausgegeben werden sollen. Es gibt drei Optionen für die Dateiausgabe mit Amazon S3:
Dateien automatisch generieren (empfohlen) — Hat die optimale Anzahl von Ausgabedateien DataBrew ermittelt.
Einzeldateiausgabe — Bewirkt, dass eine einzelne Ausgabedatei generiert wird. Diese Option kann zu zusätzlicher Job-Ausführungszeit führen, da eine Nachbearbeitung erforderlich ist.
Ausgabe mehrerer Dateien — Hier können Sie die Anzahl der Dateien für Ihre Jobausgabe angeben. Gültige Werte sind 2—999. Es werden möglicherweise weniger Dateien als von Ihnen angegeben ausgegeben, wenn die Spaltenpartitionierung verwendet wird oder wenn die Anzahl der Zeilen in der Ausgabe geringer ist als die Anzahl der von Ihnen angegebenen Dateien.
-
(Optional) Wählen Sie die Spaltenpartitionierung für die Ausgabe von Rezept-Jobs.
Die Spaltenpartitionierung bietet eine weitere Möglichkeit, die Ausgabe Ihrer Rezepturaufgabe in mehrere Dateien zu partitionieren. Die Spaltenpartitionierung kann mit einer neuen oder vorhandenen Amazon S3 S3-Ausgabe oder mit der neuen Amazon S3 S3-Ausgabe von Data Catalog verwendet werden. Es kann nicht mit vorhandenen Amazon S3 S3-Tabellen von Data Catalog verwendet werden. Die Ausgabedateien basieren auf den Werten der von Ihnen angegebenen Spaltennamen. Wenn die von Ihnen angegebenen Spaltennamen eindeutig sind, basieren die resultierenden Amazon S3 S3-Ordnerpfade auf der Reihenfolge der Spaltennamen.
Ein Beispiel für die Partitionierung von Spalten finden Sie Beispiel für die Partitionierung von Spalten im Folgenden.
-
-
(Optional) Wählen Sie Verschlüsselung für Job-Ausgabe aktivieren aus, um die Job-Ausgabe zu verschlüsseln, die an Ihren Ausgabespeicherort DataBrew schreibt, und wählen Sie dann die Verschlüsselungsmethode aus:
SSE-S3 Verschlüsselung verwenden — Die Ausgabe wird mit serverseitiger Verschlüsselung mit von Amazon S3 verwalteten Verschlüsselungsschlüsseln verschlüsselt.
Verwenden AWS Key Management Service(AWS KMS) — Die Ausgabe wird verschlüsselt mit.AWS KMS Um diese Option zu verwenden, wählen Sie den Amazon-Ressourcennamen (ARN) des AWS KMS Schlüssels, den Sie verwenden möchten. Wenn Sie keinen AWS KMS Schlüssel haben, können Sie einen erstellen, indem Sie Create an AWS KMS key wählen.
-
Wählen Sie für Zugriffsberechtigungen eine AWS Identity and Access Management(IAM-) Rolle aus, mit der Sie in Ihren Ausgabespeicherort schreiben können DataBrew . Für einen Standort, der Ihrem AWS Konto gehört, können Sie die vom
AwsGlueDataBrewDataAccessRoleDienst verwaltete Rolle wählen. Auf diese Weise können Sie DataBrew auf AWS Ressourcen zugreifen, die Ihnen gehören. -
Im Bereich Erweiterte Jobeinstellungen können Sie weitere Optionen für die Ausführung Ihres Jobs auswählen:
-
Maximale Anzahl von Einheiten — DataBrew verarbeitet Jobs unter Verwendung mehrerer Rechenknoten, die parallel ausgeführt werden. Die Standardanzahl von Knoten ist 5. Die maximale Anzahl von Knoten ist 149.
-
Job-Timeout — Wenn die Ausführung eines Jobs länger als die von Ihnen hier festgelegte Anzahl von Minuten dauert, schlägt er mit einem Timeout-Fehler fehl. Der Standardwert ist 2.880 Minuten oder 48 Stunden.
-
Anzahl der Wiederholungen — Wenn ein Job während der Ausführung fehlschlägt, DataBrew kann versucht werden, ihn erneut auszuführen. Standardmäßig wird der Job nicht erneut versucht.
-
Amazon CloudWatch Logs für Job aktivieren — Ermöglicht DataBrew die Veröffentlichung von Diagnoseinformationen in CloudWatch Logs. Diese Protokolle können zur Fehlerbehebung oder für weitere Informationen zur Verarbeitung des Jobs nützlich sein.
-
-
Bei Zeitplan-Jobs können Sie einen DataBrew Job-Zeitplan anwenden, sodass Ihr Job zu einem bestimmten Zeitpunkt oder in regelmäßigen Abständen ausgeführt wird. Weitere Informationen finden Sie unter Automatisieren von Jobläufen mit einem Zeitplan.
-
Wenn die Einstellungen Ihren Wünschen entsprechen, wählen Sie Job erstellen. Oder, wenn Sie den Job sofort ausführen möchten, wählen Sie Job erstellen und ausführen.
Sie können den Fortschritt Ihres Jobs überwachen, indem Sie dessen Status überprüfen, während der Job ausgeführt wird. Wenn die Auftragsausführung abgeschlossen ist, ändert sich der Status in Erfolgreich. Die Jobausgabe ist jetzt an dem von Ihnen ausgewählten Ausgabeort verfügbar.
DataBrew speichert Ihre Jobdefinition, sodass Sie denselben Job später ausführen können. Um einen Job erneut auszuführen, wählen Sie Jobs im Navigationsbereich aus. Wählen Sie den Job aus, mit dem Sie arbeiten möchten, und klicken Sie dann auf Job ausführen.
Beispiel für die Partitionierung von Spalten
Gehen Sie als Beispiel für die Spaltenpartitionierung davon aus, dass Sie drei Spalten angeben, von denen jede Zeile einen von zwei möglichen Werten enthält. Die Dept Spalte kann den Wert Admin oder Eng haben. Die Staff-type Spalte kann den Wert Part-time oder habenFull-time. Die Location Spalte kann den Wert Office1 oder habenOffice2. Die Amazon S3 S3-Buckets für Ihre Jobausgabe sehen ungefähr wie folgt aus.
s3://bucket/output-folder/Dept=Admin/Staff-type=Part-time/Area=Office1/jobId_timestamp_part0001.csv s3://bucket/output-folder/Dept=Admin/Staff-type=Part-time/Location=Office2/jobId_timestamp_part0002.csv s3://bucket/output-folder/Dept=Admin/Staff-type=Full-time/Location=Office1/jobId_timestamp_part0003.csv s3://bucket/output-folder/Dept=Admin/Staff-type=Full-time/Location=Office2/jobId_timestamp_part0004.csv s3://bucket/output-folder/Dept=Eng/Staff-type=Part-time/Location=Office1/jobId_timestamp_part0005.csv s3://bucket/output-folder/Dept=Eng/Staff-type=Part-time/Location=Office2/jobId_timestamp_part0006.csv s3://bucket/output-folder/Dept=Eng/Staff-type=Full-time/Location=Office1/jobId_timestamp_part0007.csv s3://bucket/output-folder/Dept=Eng/Staff-type=Full-time/Location=Office2/jobId_timestamp_part0008.csv
Automatisieren von Jobläufen mit einem Zeitplan
Sie können DataBrew Jobs jederzeit erneut ausführen und auch DataBrew Jobausführungen mit einem Zeitplan automatisieren.
Um einen Job erneut auszuführen DataBrew
Melden Sie sich bei der an AWS-Managementkonsole und öffnen Sie die DataBrew Konsole unter https://console.aws.amazon.com/databrew/
. -
Wählen Sie im Navigationsbereich Jobs aus. Wählen Sie den Job aus, den Sie ausführen möchten, und klicken Sie dann auf Job ausführen.
Um einen DataBrew Job zu einem bestimmten Zeitpunkt oder in regelmäßigen Abständen auszuführen, erstellen Sie einen DataBrew Job-Zeitplan. Anschließend können Sie Ihren Job so einrichten, dass er gemäß dem Zeitplan ausgeführt wird.
Um einen DataBrew Job-Zeitplan zu erstellen
-
Wählen Sie im Navigationsbereich der DataBrew Konsole Jobs aus. Wählen Sie die Registerkarte Zeitpläne und dann Zeitplan hinzufügen aus.
-
Geben Sie einen Namen für Ihren Zeitplan ein und wählen Sie dann einen Wert für die Ausführungshäufigkeit:
Wiederkehrend — Wählen Sie aus, wie oft der Job ausgeführt werden soll (z. B. alle 12 Stunden). Wählen Sie dann aus, an welchem Tag oder an welchen Tagen der Job ausgeführt werden soll. Optional können Sie die Tageszeit eingeben, zu der der Job ausgeführt wird.
Zu einer bestimmten Zeit — Geben Sie die Tageszeit ein, zu der der Job ausgeführt werden soll. Wählen Sie dann aus, an welchem Tag oder an welchen Tagen der Job ausgeführt werden soll.
CRON eingeben — Definieren Sie den Job-Zeitplan, indem Sie einen gültigen Cron-Ausdruck eingeben. Weitere Informationen finden Sie unter Mit Cron-Ausdrücken für Rezeptjobs arbeiten.
-
Wenn Sie die gewünschten Einstellungen vorgenommen haben, wählen Sie Save (Speichern) aus.
Um einen Job einem Zeitplan zuzuordnen
-
Wählen Sie im Navigationsbereich Jobs aus.
-
Wählen Sie den Job aus, mit dem Sie arbeiten möchten, und wählen Sie dann für Aktionen die Option Bearbeiten aus. .
-
Wählen Sie im Bereich Jobs planen die Option Zeitplan zuordnen aus. Wählen Sie den Namen des Zeitplans aus, den Sie verwenden möchten.
-
Wenn Sie die gewünschten Einstellungen vorgenommen haben, wählen Sie Save (Speichern) aus.
Mit Cron-Ausdrücken für Rezeptjobs arbeiten
Cron-Ausdrücke verfügen über sechs Pflichtfelder, die durch Leerzeichen voneinander getrennt sind. Die Syntax ist wie folgt.
Minutes Hours Day-of-month Month Day-of-week Year
In der vorherigen Syntax werden die folgenden Werte und Platzhalter für die angegebenen Felder verwendet.
| Felder | Werte | Platzhalter |
|---|---|---|
|
Minuten |
0-59 |
, - * / |
|
Stunden |
0–23 |
, - * / |
|
Day-of-month |
1-31 |
, - * ? / L W |
|
Monat |
1—12 oder JAN-DEC |
, - * / |
|
Day-of-week |
1—7 oder SUN-SAT |
, - * ? / L |
|
Jahr |
1970-2199 |
, - * / |
Verwenden Sie diese Platzhalter wie folgt:
-
Das Platzhalterzeichen , (Komma) schließt zusätzliche Werte ein. In
Monthdiesem FeldJAN,FEB,MARsind Januar, Februar und März enthalten. -
Der Platzhalter - (mit Gedankenstrich) gibt Bereiche an. In dem
DayFeld umfasst 1—15 die Tage 1 bis 15 des angegebenen Monats. -
Das Platzhalterzeichen * (Sternchen) steht für alle Werte im Feld. In dem
HoursFeld schließt ein* jede Stunde ein. -
Das Platzhalterzeichen / (Schrägstrich) steht für schrittweise Steigerungen. In das
MinutesFeld können Sie angeben,1/10dass ab der ersten Minute der Stunde jede 10. Minute angegeben werden soll (z. B. die 11., 21. und 31. Minute). -
Das Platzhalterzeichen ? (Fragezeichen) steht für einen Wert. Nehmen wir beispielsweise an, dass Sie in das
Day-of-monthFeld 7 eingeben. Wenn es Ihnen egal war, welcher Wochentag der siebte war, können Sie dann eingeben? auf demDay-of-weekFeld. -
Der Platzhalter L im
Day-of-weekFeldDay-of-monthoder gibt den letzten Tag des Monats oder der Woche an. -
Das Platzhalterzeichen W im Feld
Day-of-monthgibt einen Wochentag an. Im FeldDay-of-monthgibt den3Wden Tag an, der dem dritten Tag des Monats am nächsten ist.
Für diese Felder und Werte gelten die folgenden Einschränkungen:
-
Es ist nicht möglich, die Felder
Day-of-monthundDay-of-weekim gleichen Cron-Ausdruck anzugeben. Wenn Sie einen Wert in einem der Felder angeben, müssen Sie in dem anderen Feld ein ? (Fragezeichen) eingeben. -
Cron-Ausdrücke, die zu Raten von mehr als 5 Minuten führen, werden nicht unterstützt.
Wenn Sie einen Zeitplan erstellen, können Sie die folgenden Beispiel-Cron-Strings verwenden.
| Minuten | Stunden | Tag des Monats | Monat | Wochentag | Jahr | Bedeutung |
|---|---|---|---|---|---|---|
|
0 |
10 |
* |
* |
? |
* |
Führen Sie jeden Tag um 10:00 Uhr (UTC) aus |
|
15 |
12 |
* |
* |
? |
* |
Ausführung jeden Tag um 12:15 Uhr (UTC) |
|
0 |
18 |
? |
* |
MON-FRI |
* |
Ausführung jeden Montag bis Freitag um 18:00 Uhr (UTC) |
|
0 |
8 |
1 |
* |
? |
* |
Läuft jeden ersten Tag des Monats um 8:00 Uhr (UTC) |
|
0/15 |
* |
* |
* |
? |
* |
Ausführung alle 15 Minuten |
|
0/10 |
* |
? |
* |
MON-FRI |
* |
Ausführung alle 10 Minuten von Montag bis Freitag |
|
0/5 |
8-17 |
? |
* |
MON-FRI |
* |
Ausführung alle 5 Minuten von Montag bis Freitag zwischen 08:00 Uhr und 17:55 Uhr (UTC) |
Sie können beispielsweise den folgenden Cron-Ausdruck verwenden, um jeden Tag um 12:15 Uhr UTC einen Job auszuführen.
15 12 * * ? *
Jobs und Jobpläne löschen
Wenn Sie einen Job oder einen Jobplan nicht mehr benötigen, können Sie ihn löschen.
Einen Auftrag löschen
-
Wählen Sie im Navigationsbereich Jobs aus.
-
Wählen Sie den Job aus, den Sie löschen möchten, und wählen Sie dann für Aktionen die Option Löschen aus. .
Um einen Jobplan zu löschen
-
Wählen Sie im Navigationsbereich Jobs und dann die Registerkarte Zeitpläne aus.
-
Wählen Sie den Zeitplan aus, den Sie löschen möchten, und wählen Sie dann für Aktionen die Option Löschen aus. .