Le traduzioni sono generate tramite traduzione automatica. In caso di conflitto tra il contenuto di una traduzione e la versione originale in Inglese, quest'ultima prevarrà.
Creare e lavorare con AWS Glue DataBrew lavori di ricette
Usa un processo di DataBrew ricetta per pulire e normalizzare i dati in un DataBrew set di dati e scrivi il risultato in una posizione di output a tua scelta. L'esecuzione di un processo di ricetta non influisce sul set di dati o sui dati di origine sottostanti. Quando un processo viene eseguito, si connette ai dati di origine in modalità di sola lettura. L'output del lavoro viene scritto in una posizione di output definita in Amazon S3 AWS Glue Data Catalog, o in un database JDBC supportato.
Utilizza la seguente procedura per creare un DataBrew processo di elaborazione delle ricette.
Per creare un processo di creazione di ricette
Accedi a Console di gestione AWS e apri la DataBrew console all'indirizzo https://console.aws.amazon.com/databrew/
. Scegli JOBS dal pannello di navigazione, scegli la scheda Recipe jobs, quindi scegli Crea lavoro.
-
Inserisci un nome per il tuo lavoro, quindi scegli Crea un lavoro di ricetta.
-
Per Job input, inserisci i dettagli sul lavoro che desideri creare: il nome del set di dati da elaborare e la ricetta da utilizzare.
Un processo di ricetta utilizza una DataBrew ricetta per trasformare un set di dati. Per utilizzare una ricetta, assicurati di pubblicarla prima.
-
Configura le impostazioni di output del lavoro.
Fornisci una destinazione per la tua produzione lavorativa. Se non disponi di una DataBrew connessione configurata per la destinazione di output, configurala prima nella scheda DATASETS come descritto inConnessioni supportate per sorgenti e uscite di dati. Scegliete una delle seguenti destinazioni di output:
Amazon S3, con o senza supporto AWS Glue Data Catalog
Amazon Redshift, con o senza supporto AWS Glue Data Catalog
JDBC
Tavoli Snowflake
Tabelle di database Amazon RDS con AWS Glue Data Catalog supporto. Le tabelle di database Amazon RDS supportano i seguenti motori di database:
Amazon Aurora
MySQL
Oracle
PostgreSQL
Microsoft SQL Server
Amazon S3 con AWS Glue Data Catalog supporto.
Per l'AWS Glue Data Catalog output basato su AWS Lake Formation, DataBrew supporta solo la sostituzione di file esistenti. In questo approccio, i file vengono sostituiti per mantenere intatte le autorizzazioni esistenti di Lake Formation per il tuo ruolo di accesso ai dati. Inoltre, DataBrew dà la precedenza alla posizione di Amazon S3 nella tabella.AWS Glue Data Catalog Pertanto, non puoi sovrascrivere la posizione di Amazon S3 durante la creazione di un processo di creazione di ricette.
In alcuni casi, la posizione di Amazon S3 nell'output del lavoro è diversa dalla posizione Amazon S3 nella tabella Data Catalog. In questi casi, DataBrew aggiorna automaticamente la definizione del processo con la posizione Amazon S3 dalla tabella del catalogo. Lo fa quando aggiorni o avvii i lavori esistenti.
-
Solo per le destinazioni di output di Amazon S3, hai altre scelte:
-
Scegli uno dei formati di output dei dati disponibili per Amazon S3, la compressione opzionale e un delimitatore personalizzato opzionale. I delimitatori supportati per i file di output sono gli stessi di quelli di input: virgola, virgola, punto e virgola, pipe, tab, caret, backslash e space. Per i dettagli sulla formattazione, consultate la tabella seguente.
Format (Formato) Estensione del file (non compressa) Estensioni di file (compresse) Comma-separated valori
.csv.csv.snappy,.csv.gz,.csv.lz4,csv.bz2,.csv.deflate,csv.brTab-separated valori
.csv.tsv.snappy,.tsv.gz,.tsv.lz4,tsv.bz2,.tsv.deflate,tsv.brApache Parquet .parquet.parquet.snappy,.parquet.gz,.parquet.lz4,.parquet.lzo,.parquet.brAWS Glue parquet Non supportata .glue.parquet.snappyApache Avro .avro.avro.snappy,.avro.gz,.avro.lz4,.avro.bz2,.avro.deflate,.avro.brApache ORC .orc.orc.snappy,.orc.lzo,.orc.zlibXML .xml.xml.snappy,.xml.gz,.xml.lz4,.xml.bz2,.xml.deflate,.xml.brJSON (solo formato JSON Lines) .json.json.snappy,.json.gz,.json.lz4,json.bz2,.json.deflate,.json.brTableau Hyper Non supportata Non applicabile -
Scegli se stampare un singolo file o più file. Esistono tre opzioni per l'output di file con Amazon S3:
Generazione automatica di file (scelta consigliata): consente di DataBrew determinare il numero ottimale di file di output.
Output a file singolo: consente la generazione di un singolo file di output. Questa opzione può comportare un ulteriore tempo di esecuzione del lavoro poiché è necessaria la post-elaborazione.
Output di più file: consente di specificare il numero di file per l'output del lavoro. I valori validi sono 2—999. È possibile che venga emesso un numero inferiore di file di quelli specificati se si utilizza il partizionamento delle colonne o se il numero di righe nell'output è inferiore al numero di file specificato.
-
(Facoltativo) Scegliete il partizionamento delle colonne per l'output del processo di creazione delle ricette.
Il partizionamento delle colonne offre un altro modo per suddividere l'output del processo di preparazione della ricetta in più file. Il partizionamento delle colonne può essere utilizzato con un output Amazon S3 nuovo o esistente o con un nuovo output Amazon S3 di Data Catalog. Non può essere utilizzato con le tabelle Amazon S3 di Data Catalog esistenti. I file di output si basano sui valori dei nomi delle colonne specificati. Se i nomi delle colonne specificati sono univoci, i percorsi delle cartelle Amazon S3 risultanti si basano sull'ordine dei nomi delle colonne.
Per un esempio di partizionamento delle colonne, consulta Esempio di partizionamento delle colonne quanto segue.
-
-
(Facoltativo) Scegliete Abilita la crittografia per l'output del lavoro per crittografare l'output del lavoro che DataBrew scrive nella posizione di output, quindi scegliete il metodo di crittografia:
Usa la SSE-S3 crittografia: l'output viene crittografato utilizzando la crittografia lato server con chiavi di crittografia gestite da Amazon S3.
Usa AWS Key Management Service(AWS KMS): l'output viene crittografato utilizzando.AWS KMS Per utilizzare questa opzione, scegli l'Amazon Resource Name (ARN) della AWS KMS chiave che desideri utilizzare. Se non disponi di una AWS KMS chiave, puoi crearne una scegliendo Crea una AWS KMS chiave.
-
Per le autorizzazioni di accesso, scegli un ruolo AWS Identity and Access Management(IAM) che DataBrew consenta di scrivere nella tua posizione di output. Per una sede di proprietà del tuo AWS account, puoi scegliere il ruolo gestito dal
AwsGlueDataBrewDataAccessRoleservizio. In questo modo puoi accedere DataBrew alle AWS risorse di tua proprietà. -
Nel riquadro Impostazioni avanzate del processo, puoi scegliere altre opzioni per l'esecuzione del lavoro:
-
Numero massimo di unità: DataBrew elabora i lavori utilizzando più nodi di elaborazione, in esecuzione in parallelo. Il numero predefinito di nodi è 5. Il numero massimo di nodi è 149.
-
Job timeout: se l'esecuzione di un processo richiede più del numero di minuti impostato qui, fallisce con un errore di timeout. Il valore predefinito è 2.880 minuti o 48 ore.
-
Numero di tentativi: se un processo fallisce durante l'esecuzione, DataBrew puoi provare a eseguirlo di nuovo. Per impostazione predefinita, il processo non viene ritentato.
-
Abilita Amazon CloudWatch Logs for job: consente di DataBrew pubblicare informazioni diagnostiche su CloudWatch Logs. Questi log possono essere utili per la risoluzione dei problemi o per maggiori dettagli su come viene elaborato il lavoro.
-
-
Per Schedule jobs, è possibile applicare una DataBrew pianificazione dei lavori in modo che il lavoro venga eseguito in un determinato momento o su base ricorrente. Per ulteriori informazioni, consulta Automatizzazione delle esecuzioni dei lavori con una pianificazione.
-
Quando le impostazioni sono quelle che desideri, scegli Crea lavoro. Oppure, se desideri eseguire il lavoro immediatamente, scegli Crea ed esegui processo.
Puoi monitorare l'avanzamento del lavoro controllandone lo stato mentre il lavoro è in esecuzione. Una volta completata l'esecuzione del processo, lo stato passa a Riuscito. L'output del lavoro è ora disponibile nella posizione di output prescelta.
DataBrew salva la definizione del processo, in modo da poter eseguire lo stesso lavoro in un secondo momento. Per eseguire nuovamente un lavoro, scegli Jobs dal pannello di navigazione. Scegli il lavoro con cui vuoi lavorare, quindi scegli Esegui lavoro.
Esempio di partizionamento delle colonne
Come esempio di partizionamento delle colonne, si supponga di specificare tre colonne, ciascuna delle quali contiene uno dei due valori possibili. La Dept colonna può avere il valore Admin o. Eng La Staff-type colonna può avere il valore Part-time oFull-time. La Location colonna può avere il valore Office1 oOffice2. I bucket Amazon S3 per il tuo output di lavoro hanno un aspetto simile al seguente.
s3://bucket/output-folder/Dept=Admin/Staff-type=Part-time/Area=Office1/jobId_timestamp_part0001.csv s3://bucket/output-folder/Dept=Admin/Staff-type=Part-time/Location=Office2/jobId_timestamp_part0002.csv s3://bucket/output-folder/Dept=Admin/Staff-type=Full-time/Location=Office1/jobId_timestamp_part0003.csv s3://bucket/output-folder/Dept=Admin/Staff-type=Full-time/Location=Office2/jobId_timestamp_part0004.csv s3://bucket/output-folder/Dept=Eng/Staff-type=Part-time/Location=Office1/jobId_timestamp_part0005.csv s3://bucket/output-folder/Dept=Eng/Staff-type=Part-time/Location=Office2/jobId_timestamp_part0006.csv s3://bucket/output-folder/Dept=Eng/Staff-type=Full-time/Location=Office1/jobId_timestamp_part0007.csv s3://bucket/output-folder/Dept=Eng/Staff-type=Full-time/Location=Office2/jobId_timestamp_part0008.csv
Automatizzazione delle esecuzioni dei lavori con una pianificazione
È possibile eseguire nuovamente i DataBrew lavori in qualsiasi momento e anche automatizzare le esecuzioni dei lavori con una DataBrew pianificazione.
Per eseguire nuovamente un processo DataBrew
Accedi a Console di gestione AWS e apri la DataBrew console all'indirizzo. https://console.aws.amazon.com/databrew/
-
Nel riquadro di navigazione, scegli Jobs. Scegli il lavoro che desideri eseguire, quindi scegli Esegui processo.
Per eseguire un DataBrew lavoro in un momento particolare o su base ricorrente, crea una pianificazione dei DataBrew lavori. È quindi possibile impostare il lavoro in modo che venga eseguito in base alla pianificazione.
Per creare una pianificazione dei DataBrew lavori
-
Nel riquadro di navigazione della DataBrew console, scegli Jobs. Scegli la scheda Pianificazioni e scegli Aggiungi pianificazione.
-
Inserisci un nome per la tua pianificazione, quindi scegli un valore per Frequenza di esecuzione:
Periodico: scegli la frequenza con cui desideri che il processo venga eseguito (ad esempio, ogni 12 ore). Quindi scegli il giorno o i giorni in cui eseguire il lavoro. Facoltativamente, è possibile inserire l'ora del giorno in cui viene eseguito il lavoro.
A un'ora particolare: immettere l'ora del giorno in cui si desidera che il lavoro venga eseguito. Quindi scegli il giorno o i giorni in cui eseguire il lavoro.
Inserisci CRON: definisci la pianificazione dei lavori inserendo un'espressione cron valida. Per ulteriori informazioni, consulta Lavorare con le espressioni cron per i lavori di creazione di ricette.
-
Dopo aver selezionato le impostazioni desiderate, scegli Save (Salva).
Per associare un lavoro a una pianificazione
-
Nel riquadro di navigazione, scegli Jobs.
-
Scegli il lavoro su cui vuoi lavorare, quindi per Azioni, scegli Modifica. .
-
Nel riquadro Pianifica lavori, scegli Associa pianificazione. Scegli il nome della pianificazione che desideri utilizzare.
-
Dopo aver selezionato le impostazioni desiderate, scegli Save (Salva).
Lavorare con le espressioni cron per i lavori di creazione di ricette
Le espressioni Cron hanno sei campi obbligatori separati da uno spazio vuoto. La sintassi è esposta di seguito.
Minutes Hours Day-of-month Month Day-of-week Year
Nella sintassi precedente, i seguenti valori e caratteri jolly vengono utilizzati per i campi indicati.
| Campi | Valori | Caratteri jolly |
|---|---|---|
|
Minuti |
0-59 |
, - * / |
|
Ore |
0-23 |
, - * / |
|
Day-of-month |
1-31 |
, - * ? / L W |
|
Mese |
1—12 oppure JAN-DEC |
, - * / |
|
Day-of-week |
1—7 o SUN-SAT |
, - * ? / L |
|
Anno |
1970–2199 |
, - * / |
Usa questi caratteri jolly come segue:
-
Il carattere jolly , (virgola) include valori aggiuntivi. Nel
Monthcampo,JAN,FEB,MARinclude gennaio, febbraio e marzo. -
Il carattere jolly - (en dash) specifica gli intervalli. Nel
Daycampo, 1—15 include i giorni da 1 a 15 del mese specificato. -
Il carattere jolly * (asterisco) include tutti i valori nel campo. Nel
Hourscampo, * include ogni ora. -
Il carattere jolly / (barra) specifica gli incrementi. Nel
Minutescampo è possibile inserire1/10per specificare ogni decimo minuto, a partire dal primo minuto dell'ora (ad esempio, l'undicesimo, il ventunesimo e il 31° minuto). -
Il carattere jolly ? (punto interrogativo) specifica un valore. Ad esempio, supponiamo che nel
Day-of-monthcampo si inserisca 7. Se non ti interessa in che giorno della settimana è il settimo, puoi inserire? sulDay-of-weekcampo. -
Il carattere L nel
Day-of-weekcampoDay-of-monthor specifica l'ultimo giorno del mese o della settimana. -
Il carattere jolly W nel campo
Day-of-monthspecifica un giorno feriale. Nel campoDay-of-month,3Wspecifica il giorno più vicino al terzo giorno feriale del mese.
Questi campi e valori presentano le seguenti limitazioni:
-
Non puoi specificare i campi
Day-of-montheDay-of-weeknella stessa espressione cron. Se specifichi un valore in uno dei campi, devi usare un carattere ? nell'altro campo. -
Le espressioni Cron che portano a tassi superiori a 5 minuti non sono supportate.
Quando crei una pianificazione puoi utilizzare le seguenti stringhe cron di esempio.
| Minuti | Ore | Giorno del mese | Mese | Giorno della settimana | Anno | Significato |
|---|---|---|---|---|---|---|
|
0 |
10 |
* |
* |
? |
* |
Esegui ogni giorno alle 10:00 (UTC) |
|
15 |
12 |
* |
* |
? |
* |
Esegui ogni giorno alle 12.15 (UTC) |
|
0 |
18 |
? |
* |
MON-FRI |
* |
Esegui dal lunedì al venerdì alle 18.00 (UTC) |
|
0 |
8 |
1 |
* |
? |
* |
Esegui alle 8:00 (UTC) ogni primo giorno del mese |
|
0/15 |
* |
* |
* |
? |
* |
Esegui ogni 15 minuti |
|
0/10 |
* |
? |
* |
MON-FRI |
* |
Esegui dal lunedì al venerdì ogni 10 minuti |
|
0/5 |
8-17 |
? |
* |
MON-FRI |
* |
Esegui dal lunedì al venerdì dalle 8.00 alle 17:55 (UTC) ogni 5 minuti |
Ad esempio, puoi utilizzare la seguente espressione cron per eseguire un job ogni giorno alle 12:15 UTC.
15 12 * * ? *
Eliminazione di lavori e pianificazioni di lavoro
Se non hai più bisogno di un lavoro o di una pianificazione dei lavori, puoi eliminarli.
Come eliminare un processo
-
Nel riquadro di navigazione, scegli Jobs.
-
Scegli il lavoro che desideri eliminare, quindi per Azioni, scegli Elimina. .
Per eliminare una pianificazione dei lavori
-
Nel riquadro di navigazione, scegli Lavori, quindi scegli la scheda Pianificazioni.
-
Scegli la pianificazione che desideri eliminare, quindi per Azioni, scegli Elimina. .