View a markdown version of this page

Conexiones compatibles para fuentes y salidas de datos - AWS Glue DataBrew Guía para desarrolladores

Las traducciones son generadas a través de traducción automática. En caso de conflicto entre la traducción y la version original de inglés, prevalecerá la version en inglés.

Conexiones compatibles para fuentes y salidas de datos

Puede conectarse a las siguientes fuentes de datos para realizar trabajos con DataBrew recetas. Estas incluyen cualquier fuente de datos que no sea un archivo al que vaya a DataBrew subir directamente. La fuente de datos que está utilizando podría denominarse base de datos, almacén de datos o cualquier otro nombre. Nos referimos a todos los proveedores de datos como fuentes de datos o conexiones.

Puede crear un conjunto de datos utilizando cualquiera de las siguientes fuentes de datos.

También puede utilizar las bases de datos Amazon S3 o JDBC compatibles con Amazon RDS para la salida de los trabajos de DataBrew recetas.AWS Glue Data Catalog Amazon AppFlow y AWS Data Exchange no son almacenes de datos compatibles para la producción de trabajos de DataBrew recetas.

  • Amazon S3

    Puede usar S3 para almacenar y proteger cualquier cantidad de datos. Para crear un conjunto de datos, especifique una URL de S3 desde la que DataBrew pueda acceder a un archivo de datos, por ejemplo: s3://your-bucket-name/inventory-data.csv

    DataBrew también puede leer todos los archivos de una carpeta S3, lo que significa que puede crear un conjunto de datos que abarque varios archivos. Para ello, especifique una URL de S3 de esta forma:s3://your-bucket-name/your-folder-name/.

    DataBrew solo admite las siguientes clases de almacenamiento de Amazon S3: Estándar, Redundancia reducida y S3 One Zone-IA. Standard-IA DataBrew ignora los archivos con otras clases de almacenamiento. DataBrew también ignora los archivos vacíos (archivos que contienen 0 bytes). Para obtener más información sobre las clases de almacenamiento de Amazon S3, consulte Uso de las clases de almacenamiento de Amazon S3 en la Guía del usuario de Amazon S3 Console.

  • AWS Glue Data Catalog

    Puede usar el catálogo de datos para definir las referencias a los datos almacenados en la AWS nube. Con el catálogo de datos, puede crear conexiones a tablas individuales en los siguientes servicios:

    • Catálogo de datos Amazon S3

    • Catálogo de datos Amazon Redshift

    • Catálogo de datos Amazon RDS

    • AWS Glue

    DataBrew también puede leer todos los archivos de una carpeta de Amazon S3, lo que significa que puede crear un conjunto de datos que abarque varios archivos. Para ello, especifique una URL de Amazon S3 de la siguiente forma: s3://your-bucket-name/your-folder-name/

    Para poder utilizarlas con DataBrew, las tablas de Amazon S3 definidas en AWS Glue Data Catalog, deben tener agregada una propiedad de tabla llamada aclassification, que identifique el formato de los datos como csv jsonparquet, o y typeOfData comofile. Si la propiedad de la tabla no se agregó cuando se creó la tabla, puede agregarla mediante la AWS Glue consola.

    DataBrew solo admite las clases de almacenamiento Standard, Reduced Redundancy y S3 One Zone-IA de Amazon S3. Standard-IA DataBrew ignora los archivos con otras clases de almacenamiento. DataBrew también ignora los archivos vacíos (archivos que contienen 0 bytes). Para obtener más información sobre las clases de almacenamiento de Amazon S3, consulte Uso de las clases de almacenamiento de Amazon S3 en la Guía del usuario de Amazon S3 Console.

    DataBrew también puede acceder a las tablas de AWS Glue Data Catalog S3 desde otras cuentas si se crea una política de recursos adecuada. Puede crear una política en la AWS Glue consola, en la pestaña Configuración, en el Catálogo de datos. El siguiente es un ejemplo de política específica para una sola persona Región de AWS.

    aviso

    Se trata de una política de recursos muy permisiva que concede acceso *$ACCOUNT_TO* sin restricciones al catálogo de datos de. *$ACCOUNT_FROM* En la mayoría de los casos, se recomienda limitar la política de recursos a catálogos o tablas específicos. Para obtener más información, consulte las políticas AWS Glue de recursos para el control de acceso en la Guía para AWS Glue desarrolladores.

    En algunos casos, puede que desee crear un proyecto o ejecutar un trabajo *$ACCOUNT_TO* con una tabla de S3 del catálogo de AWS Glue datos *$ACCOUNT_FROM* que apunte a una ubicación de S3 que también esté en*$ACCOUNT_FROM*.AWS Glue DataBrew En esos casos, la función de IAM utilizada al crear el proyecto y la tarea *$ACCOUNT_TO* debe tener permiso para enumerar y obtener los objetos de esa ubicación de *$ACCOUNT_FROM* S3. Para obtener más información, consulta Cómo conceder acceso a varias cuentas en la Guía AWS Glue para desarrolladores.

  • Datos conectados mediante controladores JDBC

    Puede crear un conjunto de datos conectándose a los datos con un controlador JDBC compatible. Para obtener más información, consulte Uso de controladores con AWS Glue DataBrew.

    DataBrew admite oficialmente las siguientes fuentes de datos mediante Java Database Connectivity (JDBC):

    • Microsoft SQL Server

    • MySQL

    • Oracle

    • PostgreSQL

    • Amazon Redshift

    • Conector Snowflake para Spark

    Las fuentes de datos se pueden ubicar en cualquier lugar desde el que pueda conectarse a ellas. DataBrew Esta lista incluye solo las conexiones JDBC que hemos probado y, por lo tanto, compatibles.

    Las fuentes de datos de Amazon Redshift y Snowflake Connector for Spark se pueden conectar de cualquiera de las siguientes maneras:

    • Con un nombre de tabla.

    • Con una consulta SQL que abarca varias tablas y operaciones.

    Las consultas SQL se ejecutan al iniciar un proyecto o ejecutar una tarea.

    Para conectarse a datos que requieren un controlador JDBC que no figura en la lista, asegúrese de que el controlador sea compatible con el JDK 8. Para usar el controlador, guárdelo en S3 en un depósito al que pueda acceder a él con su función de IAM. DataBrew A continuación, dirija el conjunto de datos al archivo del controlador. Para obtener más información, consulte Uso de controladores con AWS Glue DataBrew.

    Ejemplo de consulta para un SQL-based conjunto de datos:

    SELECT * FROM public.customer as c JOIN public.customer_address as ca on c.current_address=ca.current_address WHERE ca.address_id>0 AND ca.address_id<10001 ORDER BY ca.address_id

    Limitaciones del SQL personalizado

    Si utiliza una conexión JDBC para acceder a los datos de un DataBrew conjunto de datos, tenga en cuenta lo siguiente:

    • AWS Glue DataBrew no valida el SQL personalizado que proporciona como parte de la creación del conjunto de datos. La consulta SQL se ejecutará al iniciar un proyecto o ejecutar un trabajo. DataBrew toma la consulta que proporciona y la pasa al motor de base de datos mediante los controladores JDBC predeterminados o proporcionados.

    • Un conjunto de datos creado con una consulta no válida fallará cuando se utilice en un proyecto o trabajo. Valide la consulta antes de crear el conjunto de datos.

    • La función Validar SQL solo está disponible para las fuentes de Redshift-based datos de Amazon.

    • Si desea utilizar un conjunto de datos en un proyecto, limite el tiempo de ejecución de las consultas SQL a menos de tres minutos para evitar que se agote el tiempo de espera durante la carga del proyecto. Comprueba el tiempo de ejecución de la consulta antes de crear un proyecto.

  • Amazon AppFlow

    Con Amazon AppFlow, puede transferir datos a Amazon S3 desde aplicaciones de terceros Software-as-a-Service (SaaS) como Salesforce, Zendesk, Slack y. ServiceNow A continuación, puede usar los datos para crear un conjunto de datos. DataBrew

    En Amazon AppFlow, creas una conexión y un flujo para transferir datos entre tu aplicación de terceros y una aplicación de destino. Cuando utilices Amazon AppFlow con DataBrew, asegúrate de que la aplicación de AppFlow destino de Amazon sea Amazon S3. Las aplicaciones de AppFlow destino de Amazon distintas de Amazon S3 no aparecen en la DataBrew consola. Para obtener más información sobre la transferencia de datos desde una aplicación de terceros y la creación de AppFlow conexiones y flujos de Amazon, consulta la AppFlow documentación de Amazon.

    Si selecciona Conectar un nuevo conjunto de datos en la pestaña Conjuntos de datos DataBrew y hace clic en Amazon AppFlow, verá todos los flujos de Amazon AppFlow que están configurados con Amazon S3 como aplicación de destino. Para usar los datos de un flujo para su conjunto de datos, elija ese flujo.

    Al seleccionar Crear flujo, Administrar flujos y Ver detalles de Amazon AppFlow en la DataBrew consola, se abre la AppFlow consola de Amazon para que pueda realizar esas tareas.

    Después de crear un conjunto de datos desde Amazon AppFlow, puede ejecutar el flujo y ver los detalles de la última ejecución del flujo al ver los detalles del conjunto de datos o los detalles del trabajo. Al ejecutar el flujo DataBrew, el conjunto de datos se actualiza en S3 y está listo para usarse en DataBrew él.

    Al seleccionar un AppFlow flujo de Amazon en la DataBrew consola para crear un conjunto de datos, pueden surgir las siguientes situaciones:

    • Los datos no se han agregado: si el activador del flujo es Ejecutar bajo demanda o se ejecuta según lo programado con una transferencia de datos completa, asegúrese de agregar los datos del flujo antes de usarlos para crear un DataBrew conjunto de datos. Al agregar el flujo, se combinan todos los registros del flujo en un solo archivo. Los flujos con el tipo de activación Ejecutar según lo programado con transferencia de datos incremental o Ejecutar según el evento no requieren agregación. Para agregar datos en Amazon AppFlow, selecciona Editar configuración de flujo > Detalles de destino > Configuración adicional > Preferencia de transferencia de datos.

    • No se ha ejecutado el flujo: si el estado de ejecución de un flujo es vacío, significa una de las siguientes opciones:

      • Si el desencadenante para ejecutar el flujo es Ejecutar bajo demanda, el flujo aún no se ha ejecutado.

      • Si el desencadenante para ejecutar el flujo es Ejecutar por evento, el evento desencadenante aún no se ha producido.

      • Si el desencadenante para ejecutar el flujo es Ejecutar según lo programado, aún no se ha producido ninguna ejecución programada.

      Antes de crear un conjunto de datos con un flujo, elija Ejecutar flujo para ese flujo.

      Para obtener más información, consulta Amazon AppFlow flows en la Guía del AppFlow usuario de Amazon.

  • AWS Data Exchange

    Puede elegir entre cientos de fuentes de datos de terceros que están disponibles en AWS Data Exchange. Al suscribirse a estas fuentes de datos, obtiene la versión más actualizada de los datos.

    Para crear un conjunto de datos, debe especificar el nombre de un producto de AWS Data Exchange datos al que está suscrito y al que tiene derecho a usar.