View a markdown version of this page

Connexions prises en charge pour les sources de données et les sorties - AWS Glue DataBrew Guide du développeur

Les traductions sont fournies par des outils de traduction automatique. En cas de conflit entre le contenu d'une traduction et celui de la version originale en anglais, la version anglaise prévaudra.

Connexions prises en charge pour les sources de données et les sorties

Vous pouvez vous connecter aux sources de données suivantes pour les tâches de DataBrew recette. Il s'agit notamment de toute source de données qui n'est pas un fichier vers lequel vous importez directement. DataBrew La source de données que vous utilisez peut être appelée base de données, entrepôt de données ou autre. Nous désignons tous les fournisseurs de données par le terme « sources de données » ou « connexions ».

Vous pouvez créer un ensemble de données en utilisant l'une des sources de données suivantes.

Vous pouvez également utiliser les bases de données Amazon S3 ou JDBC prises en charge par Amazon RDS pour la sortie des tâches de DataBrew recette.AWS Glue Data Catalog Amazon AppFlow et les magasins de données AWS Data Exchange ne sont pas pris en charge pour la sortie des tâches de DataBrew recette.

  • Amazon S3

    Vous pouvez utiliser S3 pour stocker et protéger n'importe quel volume de données. Pour créer un ensemble de données, vous devez spécifier une URL S3 DataBrew permettant d'accéder à un fichier de données, par exemple : s3://your-bucket-name/inventory-data.csv

    DataBrew peut également lire tous les fichiers d'un dossier S3, ce qui signifie que vous pouvez créer un ensemble de données qui couvre plusieurs fichiers. Pour ce faire, spécifiez une URL S3 sous cette forme :s3://your-bucket-name/your-folder-name/.

    DataBrew prend uniquement en charge les classes de stockage Amazon S3 suivantes : Standard, Reduced Redundancy et S3 One. Standard-IA Zone-IA DataBrew ignore les fichiers appartenant à d'autres classes de stockage. DataBrew ignore également les fichiers vides (fichiers contenant 0 octet). Pour plus d'informations sur les classes de stockage Amazon S3, consultez la section Utilisation des classes de stockage Amazon S3 dans le guide de l'utilisateur de la console Amazon S3.

  • AWS Glue Data Catalog

    Vous pouvez utiliser le catalogue de données pour définir des références aux données stockées dans le AWS cloud. Le catalogue de données vous permet de créer des connexions à des tables individuelles dans les services suivants :

    • Catalogue de données Amazon S3

    • Catalogue de données Amazon Redshift

    • Catalogue de données Amazon RDS

    • AWS Glue

    DataBrew peut également lire tous les fichiers d'un dossier Amazon S3, ce qui signifie que vous pouvez créer un ensemble de données qui couvre plusieurs fichiers. Pour ce faire, spécifiez une URL Amazon S3 sous la forme suivante : s3://your-bucket-name/your-folder-name/

    Pour être utilisées avec DataBrew, les tables Amazon S3 définies dans le AWS Glue Data Catalog, doivent être associées à une propriété de table appelée aclassification, qui identifie le format des données comme csvjson, ouparquet, et typeOfData commefile. Si la propriété de table n'a pas été ajoutée lors de la création de la table, vous pouvez l'ajouter à l'aide de la AWS Glue console.

    DataBrew prend uniquement en charge les classes de stockage Amazon S3 Standard, Reduced Redundancy et S3 One. Standard-IA Zone-IA DataBrew ignore les fichiers appartenant à d'autres classes de stockage. DataBrew ignore également les fichiers vides (fichiers contenant 0 octet). Pour plus d'informations sur les classes de stockage Amazon S3, consultez la section Utilisation des classes de stockage Amazon S3 dans le guide de l'utilisateur de la console Amazon S3.

    DataBrew peut également accéder aux tables AWS Glue Data Catalog S3 depuis d'autres comptes si une politique de ressources appropriée est créée. Vous pouvez créer une politique dans la AWS Glue console sous l'onglet Paramètres sous Catalogue de données. Voici un exemple de politique spécifique à un célibataire Région AWS.

    Avertissement

    Il s'agit d'une politique de ressources très permissive qui accorde un accès *$ACCOUNT_TO* illimité au catalogue de données de. *$ACCOUNT_FROM* Dans la plupart des cas, nous vous recommandons de limiter votre politique de ressources à des catalogues ou à des tables spécifiques. Pour plus d'informations, consultez les politiques relatives aux AWS Glue ressources pour le contrôle d'accès dans le Guide du AWS Glue développeur.

    Dans certains cas, vous souhaiterez peut-être créer un projet ou exécuter une tâche AWS Glue DataBrew dans *$ACCOUNT_TO* une table AWS Glue Data Catalog S3 *$ACCOUNT_FROM* pointant vers un emplacement S3 également intégré*$ACCOUNT_FROM*. Dans de tels cas, le rôle IAM utilisé lors de la création du projet et de la tâche *$ACCOUNT_TO* doit être autorisé à répertorier et à obtenir des objets se trouvant dans cet emplacement S3. *$ACCOUNT_FROM* Pour plus d'informations, consultez la section Octroi d'un accès multicompte dans le guide du AWS Glue développeur.

  • Données connectées à l'aide de pilotes JDBC

    Vous pouvez créer un ensemble de données en vous connectant aux données à l'aide d'un pilote JDBC compatible. Pour de plus amples informations, veuillez consulter Utilisation de pilotes avec AWS Glue DataBrew.

    DataBrew prend officiellement en charge les sources de données suivantes à l'aide de Java Database Connectivity (JDBC) :

    • Microsoft SQL Server

    • MySQL

    • Oracle

    • PostgreSQL

    • Amazon Redshift

    • Connecteur Snowflake pour Spark

    Les sources de données peuvent être situées à n'importe quel endroit depuis lequel vous pouvez vous y connecter DataBrew. Cette liste inclut uniquement les connexions JDBC que nous avons testées et que nous pouvons donc prendre en charge.

    Les sources de données Amazon Redshift et Snowflake Connector pour Spark peuvent être connectées de l'une des manières suivantes :

    • Avec un nom de table.

    • Avec une requête SQL qui couvre plusieurs tables et opérations.

    Les requêtes SQL sont exécutées lorsque vous démarrez un projet ou que vous exécutez une tâche.

    Pour vous connecter à des données qui nécessitent un pilote JDBC non répertorié, assurez-vous que le pilote est compatible avec le JDK 8. Pour utiliser le pilote, stockez-le dans S3 dans un compartiment auquel vous pouvez accéder avec votre rôle IAM pour DataBrew. Pointez ensuite votre ensemble de données sur le fichier du pilote. Pour de plus amples informations, veuillez consulter Utilisation de pilotes avec AWS Glue DataBrew.

    Exemple de requête pour un SQL-based ensemble de données :

    SELECT * FROM public.customer as c JOIN public.customer_address as ca on c.current_address=ca.current_address WHERE ca.address_id>0 AND ca.address_id<10001 ORDER BY ca.address_id

    Limites du SQL personnalisé

    Si vous utilisez une connexion JDBC pour accéder aux données d'un DataBrew ensemble de données, gardez à l'esprit les points suivants :

    • AWS Glue DataBrew ne valide pas le code SQL personnalisé que vous fournissez dans le cadre de la création du jeu de données. La requête SQL est exécutée lorsque vous lancez un projet ou une tâche. DataBrew prend la requête que vous fournissez et la transmet au moteur de base de données à l'aide des pilotes JDBC par défaut ou fournis.

    • Un ensemble de données créé avec une requête non valide échouera s'il est utilisé dans un projet ou une tâche. Validez votre requête avant de créer l'ensemble de données.

    • La fonctionnalité Validate SQL n'est disponible que pour les sources Redshift-based de données Amazon.

    • Si vous souhaitez utiliser un ensemble de données dans un projet, limitez le temps d'exécution des requêtes SQL à moins de trois minutes afin d'éviter un délai d'attente lors du chargement du projet. Vérifiez l'exécution de la requête avant de créer un projet.

  • Amazon AppFlow

    À l'aide d'Amazon AppFlow, vous pouvez transférer des données vers Amazon S3 à partir d'applications tierces Software-as-a-Service (SaaS) telles que Salesforce, Zendesk, Slack et. ServiceNow Vous pouvez ensuite utiliser les données pour créer un DataBrew ensemble de données.

    Dans Amazon AppFlow, vous créez une connexion et un flux pour transférer des données entre votre application tierce et une application de destination. Lorsque vous utilisez Amazon AppFlow avec DataBrew, assurez-vous que l'application de AppFlow destination Amazon est Amazon S3. Les applications de AppFlow destination Amazon autres qu'Amazon S3 n'apparaissent pas dans la DataBrew console. Pour plus d'informations sur le transfert de données depuis votre application tierce et la création de AppFlow connexions et de flux Amazon, consultez la AppFlow documentation Amazon.

    Lorsque vous sélectionnez Connect new dataset dans l'onglet Datasets de DataBrew et AppFlow que vous cliquez sur Amazon AppFlow, tous les flux d'Amazon configurés avec Amazon S3 comme application de destination s'affichent. Pour utiliser les données d'un flux pour votre ensemble de données, choisissez ce flux.

    Choisissez Créer un flux, Gérer les flux et Afficher les détails d'Amazon AppFlow dans la DataBrew console pour ouvrir la AppFlow console Amazon afin que vous puissiez effectuer ces tâches.

    Après avoir créé un ensemble de données à partir d'Amazon AppFlow, vous pouvez exécuter le flux et consulter les détails de la dernière exécution du flux lorsque vous consultez les détails du jeu de données ou les détails des tâches. Lorsque vous exécutez le flux DataBrew, le jeu de données est mis à jour dans S3 et est prêt à être utilisé dans DataBrew.

    Les situations suivantes peuvent survenir lorsque vous sélectionnez un AppFlow flux Amazon dans la DataBrew console pour créer un ensemble de données :

    • Les données n'ont pas été agrégées : si le déclencheur du flux est Exécuté à la demande ou s'il est exécuté selon le calendrier avec transfert complet des données, assurez-vous d'agréger les données du flux avant de les utiliser pour créer un DataBrew ensemble de données. L'agrégation du flux combine tous les enregistrements du flux dans un seul fichier. Les flux dont le type de déclencheur est Exécuter selon le calendrier avec transfert de données incrémentiel ou Exécuter selon un événement ne nécessitent pas d'agrégation. Pour agréger les données dans Amazon AppFlow, choisissez Modifier la configuration du flux > Détails de la destination > Paramètres supplémentaires > Préférence de transfert de données.

    • Le flux n'a pas été exécuté : si le statut d'exécution d'un flux est vide, cela signifie l'une des choses suivantes :

      • Si le déclencheur pour exécuter le flux est Exécuter à la demande, le flux n'a pas encore été exécuté.

      • Si le déclencheur de l'exécution du flux est Run on event, l'événement déclencheur ne s'est pas encore produit.

      • Si le déclencheur pour exécuter le flux est Exécuter selon le calendrier, aucune exécution planifiée n'a encore eu lieu.

      Avant de créer un ensemble de données avec un flux, choisissez Run flow pour ce flux.

      Pour plus d'informations, consultez Amazon AppFlow flows dans le guide de AppFlow l'utilisateur Amazon.

  • AWS Data Exchange

    Vous pouvez choisir parmi des centaines de sources de données tierces disponibles dans AWS Data Exchange. En vous abonnant à ces sources de données, vous obtenez la version la plus récente des données.

    Pour créer un ensemble de données, vous devez spécifier le nom d'un produit de AWS Data Exchange données auquel vous êtes abonné et que vous êtes autorisé à utiliser.