View a markdown version of this page

Write-ahead registros (WAL) para Amazon EMR - Amazon EMR

Las traducciones son generadas a través de traducción automática. En caso de conflicto entre la traducción y la version original de inglés, prevalecerá la version en inglés.

Write-ahead registros (WAL) para Amazon EMR

Con Amazon EMR 6.15 y versiones posteriores, puede escribir sus registros de escritura anticipada (WAL) de Apache HBase en Amazon EMR WAL. Con versiones anteriores de Amazon EMR, al crear un clúster con la opción HBase en Amazon S3, WAL es el único componente de Apache HBase que se almacena en el disco local de los clústeres, con lo que usted puede almacenar otros componentes, como el directorio raíz, los archivos de almacenamiento (HFiles), los metadatos de las tablas y los datos en Amazon S3.

Puede usar Amazon EMR WAL para recuperar los datos que no se vaciaron en Amazon S3. Para realizar una copia de seguridad completa de sus clústeres de HBase, opte por utilizar el servicio Amazon EMR WAL. Entre bastidores, RegionServer escribe los registros de escritura anticipada (WAL) de HBase en Amazon EMR WAL.

En caso de que su clúster o la zona de disponibilidad (AZ) estén en mal estado o no estén disponibles, puede crear un clúster nuevo, dirigirlo al mismo directorio raíz de S3 y al espacio de trabajo Amazon EMR WAL y recuperar automáticamente los datos en WAL en unos minutos. Para obtener más información, consulte Restauración desde Amazon EMR WAL.

A partir de las versiones 7.3.0 y posteriores de Amazon EMR, esta plataforma crea varias WAL de EMR para cada servidor y agrupa varias regiones de HBase en una Amazon EMR WAL. De este modo, se impulsa Apache HBase WAL para mejorar la utilización de los registros y optimizar los costes. Para configurar el número de instancias de Amazon EMR WAL por RegionServer de HBase, utilice el parámetro hbase.wal.regiongrouping.numgroups. Este parámetro está establecido en 2 de forma predeterminada. Hay dos tablas del sistema que no se incluyen en ningún grupo WAL: meta y masterstore. Estas tablas siempre utilizan sus propios WAL individuales.

Si ejecuta una versión anterior a Amazon EMR 7.3.0, le recomendamos que deshabilite manualmente las tablas del clúster de HBase anterior para asegurarse de que todos los datos en Amazon EMR WAL se vacíen en Amazon S3. A continuación, elimine la Amazon EMR WAL anterior, finalice el clúster anterior y configure un clúster nuevo que ejecute la versión más reciente. Si tiene problemas y no puede deshabilitar las tablas del clúster anterior, puede finalizar directamente el clúster anterior y establecer emr.wal.multiplex.migrate en true en el nuevo clúster. Si se establece en “verdadero”, HBase intentará reproducir los datos de las instancias Amazon EMR WAL anteriores durante la inicialización de la región de HBase y eliminará las WAL anteriores después de la reproducción. Este proceso de reproducción implica costes adicionales de lectura. Tras la migración, se recomienda configurar el clúster y establecer emr.wal.multiplex.migrate en false. Si lo prefiere, puede eliminar el parámetro para acelerar la inicialización de la región de HBase.

nota

Amazon EMR WAL elimina los datos después de que HBase los vacíe. Si HBase no vacía los datos, Amazon EMR WAL los conserva durante un máximo de 30 días. Transcurridos 30 días, Amazon EMR WAL elimina automáticamente los datos. Amazon EMR conserva las instancias de WAL durante un máximo de 30 días a partir de la finalización de un clúster de EMR. Sin embargo, si lanza un nuevo WAL-enabled clúster desde el mismo directorio raíz de S3 dentro de esos 30 días, Amazon EMR no eliminará ninguna de las instancias de WAL del clúster anterior. Para obtener más información, consulte Restauración desde Amazon EMR WAL.

En las siguientes secciones se describe cómo configurar y utilizar Amazon EMR WAL con su clúster de EMR. HBase-enabled