View a markdown version of this page

Write-ahead log (WAL) untuk Amazon EMR - Amazon EMR

Terjemahan disediakan oleh mesin penerjemah. Jika konten terjemahan yang diberikan bertentangan dengan versi bahasa Inggris aslinya, utamakan versi bahasa Inggris.

Write-ahead log (WAL) untuk Amazon EMR

Dengan Amazon EMR 6.15 dan yang lebih tinggi, Anda dapat menulis log penulisan (WAL) Apache HBase Anda ke Amazon EMR WAL. Dengan rilis EMR Amazon yang lebih rendah, saat Anda membuat cluster dengan opsi HBase di Amazon S3, WAL adalah satu-satunya komponen Apache HBase yang disimpan di disk lokal untuk cluster, dan Anda dapat menyimpan komponen lain seperti direktori root, menyimpan file (HFiles), metadata tabel, dan data di Amazon S3.

Anda dapat menggunakan Amazon EMR WAL untuk memulihkan data yang tidak mengalir ke Amazon S3. Untuk sepenuhnya mencadangkan cluster HBase Anda, pilih untuk menggunakan layanan Amazon EMR WAL. Di belakang layar, RegionServer tulis log penulisan (WAL) HBase Anda ke WAL untuk Amazon EMR.

Jika klaster atau AZ Anda menjadi tidak sehat atau tidak tersedia, Anda dapat membuat cluster baru, mengarahkannya ke direktori root S3 yang sama dan ruang kerja Amazon EMR WAL, dan secara otomatis memulihkan data di WAL dalam beberapa menit. Untuk informasi selengkapnya, lihat Memulihkan dari Amazon EMR WAL.

Dimulai dengan Amazon EMR rilis 7.3.0 dan yang lebih tinggi, Amazon EMR membuat beberapa EMR WAL untuk setiap server dan mengelompokkan beberapa wilayah HBase menjadi satu Amazon EMR WAL. Melakukan hal itu meningkatkan Apache HBase WAL untuk meningkatkan pemanfaatan log dan mengoptimalkan biaya. Untuk mengonfigurasi jumlah instans Amazon EMR WAL per HBaseRegionServer, gunakan parameternya. hbase.wal.regiongrouping.numgroups Secara default, parameter ini diatur ke 2. Ada dua tabel sistem yang tidak termasuk dalam grup WAL: meta dan masterstore. Tabel ini selalu menggunakan WAL masing-masing.

Jika Anda menjalankan rilis yang lebih rendah dari Amazon EMR 7.3.0, kami sarankan Anda menonaktifkan tabel secara manual di klaster HBase lama untuk memastikan bahwa semua data di Amazon EMR WAL mengalir ke Amazon S3. Kemudian, hapus Amazon EMR WAL lama, hentikan cluster lama, dan siapkan cluster baru yang menjalankan rilis terbaru. Jika Anda mengalami masalah dan tidak dapat menonaktifkan tabel di cluster lama, Anda dapat langsung menghentikan cluster lama dan mengatur emr.wal.multiplex.migrate true ke. di cluster baru. Jika disetel ke true, HBase akan mencoba memutar ulang data dari instans Amazon EMR WAL lama selama inisialisasi wilayah HBase dan menghapus WALS lama setelah diputar ulang. Proses pemutaran ulang ini menimbulkan biaya tambahan untuk pembacaan. Setelah migrasi, kami menyarankan Anda mengonfigurasi cluster dan mengatur emr.wal.multiplex.migrate kefalse. Atau, Anda dapat menghapus parameter untuk mempercepat inisialisasi wilayah HBase.

catatan

Amazon EMR WAL menghapus data setelah HBase membilasnya. Jika HBase tidak menyiram data, Amazon EMR WAL menyimpan data selama maksimal 30 hari. Setelah 30 hari, Amazon EMR WAL secara otomatis menghapus data. Amazon EMR menyimpan instans WAL hingga 30 hari sejak Anda menghentikan kluster EMR. Namun, jika Anda meluncurkan WAL-enabled cluster baru dari direktori root S3 yang sama dalam 30 hari tersebut, Amazon EMR tidak akan menghapus instans WAL apa pun dari cluster Anda sebelumnya. Untuk informasi selengkapnya, lihat Memulihkan dari Amazon EMR WAL.

Bagian berikut menjelaskan cara mengatur dan menggunakan Amazon EMR WAL dengan kluster EMR HBase-enabled Anda.