View a markdown version of this page

Creare e lavorare con AWS Glue DataBrew lavori di profilo - AWS Glue DataBrew Guida per gli sviluppatori

Le traduzioni sono generate tramite traduzione automatica. In caso di conflitto tra il contenuto di una traduzione e la versione originale in Inglese, quest'ultima prevarrà.

Creare e lavorare con AWS Glue DataBrew lavori di profilo

I job di profilo eseguono una serie di valutazioni su un set di dati e inviano i risultati ad Amazon S3. Le informazioni raccolte dalla profilazione dei dati ti aiutano a comprendere il tuo set di dati e a decidere che tipo di fasi di preparazione dei dati potresti voler eseguire nei tuoi processi di elaborazione delle ricette.

Il modo più semplice per eseguire un processo di profilatura è utilizzare le impostazioni predefinite. DataBrew È possibile configurare il job di profilo prima di eseguirlo in modo che restituisca solo le informazioni desiderate.

Utilizzare la procedura seguente per creare un job DataBrew di profilo.

Per creare un profilo, un lavoro
  1. Accedi a Console di gestione AWS e apri la DataBrew console all'indirizzo https://console.aws.amazon.com/databrew/.

  2. Scegli JOBS dal pannello di navigazione, scegli la scheda Profile jobs, quindi scegli Crea lavoro.

  3. Inserisci un nome per il tuo lavoro, quindi scegli Crea un profilo di lavoro.

  4. Per Job input, fornisci il nome del set di dati da profilare.

  5. (Facoltativo) Configurate quanto segue nel riquadro Configurazioni del profilo di dati:

    • Configurazioni a livello di set di dati: configura i dettagli del lavoro del tuo profilo per tutte le colonne del set di dati.

      Facoltativamente, puoi attivare la capacità di rilevare e contare le righe duplicate nel set di dati. Puoi anche scegliere Abilita la matrice di correlazioni e selezionare le colonne per vedere quanto strettamente sono correlati i valori in più colonne. Per i dettagli sulle statistiche che puoi configurare a livello di set di dati, consulta. Statistiche configurabili a livello di set di dati Puoi configurare le statistiche sulla DataBrew console o utilizzando l' DataBrewAPI o gli AWS SDK.

    • Configurazioni a livello di colonna: utilizzando le impostazioni di configurazione del profilo predefinite, puoi selezionare le colonne da includere nel lavoro del tuo profilo. Utilizza Aggiungi modifica alla configurazione per selezionare le colonne per le quali limitare il numero di statistiche raccolte o sostituire la configurazione predefinita di determinate statistiche. Per i dettagli sulle statistiche che è possibile configurare a livello di colonna, vedere. Statistiche configurabili a livello di colonna Puoi configurare le statistiche sulla DataBrew console o utilizzando l' DataBrew API o gli AWS SDK.

      Assicurati che tutte le modifiche di configurazione specificate si applichino alle colonne che hai incluso nel lavoro del tuo profilo. Se ci sono conflitti tra diverse sostituzioni configurate per una colonna, l'ultima sovrascrittura in conflitto ha la priorità.

  6. (Facoltativo) È possibile creare regole di qualità dei dati e applicare set di regole aggiuntivi associati a questo set di dati o rimuovere quelli già applicati. Per ulteriori informazioni sulla convalida della qualità dei dati, vedere. Convalida della qualità dei dati in AWS Glue DataBrew

  7. Nel riquadro Impostazioni avanzate del processo, puoi scegliere altre opzioni per l'esecuzione del lavoro:

    • Numero massimo di unità: DataBrew elabora i lavori utilizzando più nodi di elaborazione, in esecuzione in parallelo. Il numero predefinito di nodi è 5. Il numero massimo di nodi è 149.

    • Job timeout: se l'esecuzione di un processo richiede più del numero di minuti impostato qui, fallisce con un errore di timeout. Il valore predefinito è 2.880 minuti o 48 ore.

    • Numero di tentativi: se un processo fallisce durante l'esecuzione, DataBrew puoi provare a eseguirlo di nuovo. Per impostazione predefinita, il processo non viene ritentato.

    • Abilita Amazon CloudWatch Logs for job: consente di DataBrew pubblicare informazioni diagnostiche su CloudWatch Logs. Questi log possono essere utili per la risoluzione dei problemi o per maggiori dettagli su come viene elaborato il lavoro.

  8. Per la pianificazione associata, è possibile applicare una pianificazione delle DataBrew mansioni in modo che l'operazione venga eseguita in un determinato momento o su base ricorrente. Per ulteriori informazioni, consulta Automatizzazione delle esecuzioni dei lavori con una pianificazione.

  9. Quando le impostazioni sono quelle che desideri, scegli Crea lavoro. Oppure, se desideri eseguire il lavoro immediatamente, scegli Crea ed esegui processo.