Terjemahan disediakan oleh mesin penerjemah. Jika konten terjemahan yang diberikan bertentangan dengan versi bahasa Inggris aslinya, utamakan versi bahasa Inggris.
SageMaker HyperPod Acara klaster slurm
Amazon SageMaker HyperPod memancarkan peristiwa klaster terstruktur yang memberikan visibilitas ke dalam perubahan operasional di klaster, grup instans, dan tingkat instans. Anda dapat menggunakan peristiwa ini untuk memantau aktivitas penyediaan, melacak operasi penskalaan, mendeteksi kegagalan, dan membangun pipeline peringatan otomatis.
Acara cluster tersedia untuk cluster HyperPod Slurm dengan NodeProvisioningMode set ke. Continuous Acara dapat diakses melalui DescribeClusterEvent API ListClusterEvents dan, konsol SageMaker AI, dan Amazon EventBridge.
Untuk skema acara lengkap, tingkat keparahan, katalog acara lengkap, dan detail EventBridge integrasi, lihatSageMaker HyperPod referensi acara cluster.
Prasyarat
-
Cluster HyperPod Slurm Anda harus
NodeProvisioningModedisetel ke.ContinuousCluster yang menggunakan mode penyediaan lama tidak memancarkan peristiwa terstruktur. -
Untuk menggunakan API, Anda memerlukan
sagemaker:ListClusterEventsdansagemaker:DescribeClusterEventizin dalam kebijakan IAM Anda.
Tipe peristiwa
HyperPod memancarkan dua kategori peristiwa untuk klaster Slurm pada penyediaan berkelanjutan: peristiwa umum yang berlaku untuk semua orkestra, dan acara. Slurm-specific
Peristiwa umum mencakup operasi infrastruktur inti seperti penyediaan dan penghentian instans, penskalaan grup instans, penanganan reservasi kapasitas, eksekusi skrip siklus hidup, manajemen ENI, siklus hidup sistem file FSx, dan alur kerja patching. Untuk daftar lengkapnya, lihat Peristiwa umum (EKS dan Slurm) di referensi peristiwa HyperPod cluster.
Slurm-specific peristiwa mencakup operasi khusus orkestra seperti validasi parameter penyediaan, pembuatan kunci munge, deteksi drift konfigurasi Slurm, konfigurasi ulang Slurm, dan rollback cluster. Peristiwa ini memberikan visibilitas ke tahapan Slurm-specific siklus hidup yang sebelumnya hanya dapat diamati melalui log. CloudWatch Untuk daftar lengkapnya, lihat Slurm-specific acara di referensi peristiwa HyperPod cluster.
Melihat acara di konsol
-
Buka konsol SageMaker AI
. -
Di panel navigasi kiri, pilih HyperPodcluster.
-
Pilih nama cluster Anda.
-
Pilih tab Acara.
Tab Peristiwa menampilkan daftar peristiwa dengan kolom untuk tingkat acara, ID peristiwa, nama sumber daya, jenis sumber daya, deskripsi, dan waktu acara. Anda dapat memfilter peristiwa berdasarkan atribut menggunakan kotak pencarian, mengurutkan berdasarkan waktu peristiwa, dan memilih ID peristiwa untuk melihat detail peristiwa lengkap termasuk metadata peristiwa dan catatan peristiwa lengkap.
Daftar acara menggunakan AWS CLI
Gunakan list-cluster-events perintah untuk mengambil peristiwa untuk klaster Anda:
aws sagemaker list-cluster-events \ --cluster-name my-slurm-cluster \ --sort-by EventTime \ --sort-order Descending \ --max-results 20
Anda dapat mempersempit hasil menggunakan filter berikut:
-
--resource-type— filter olehCluster,InstanceGroup, atauInstance. -
--instance-group-name— filter ke acara untuk grup instance tertentu. -
--node-id— filter ke acara untuk instans EC2 tertentu. -
--event-time-afterdan--event-time-before— filter ke jendela waktu tertentu.
Misalnya, untuk hanya melihat peristiwa tingkat grup instans untuk grup instance tertentu:
aws sagemaker list-cluster-events \ --cluster-name my-slurm-cluster \ --resource-type InstanceGroup \ --instance-group-name gpu-workers
Menjelaskan peristiwa tertentu
Gunakan describe-cluster-event perintah dengan ID peristiwa dari output daftar untuk mengambil detail acara lengkap, termasuk, EventLevelDescription, danEventMetadata:
aws sagemaker describe-cluster-event \ --cluster-name my-slurm-cluster \ --event-id 83ea0bb5-be77-45e8-a458-0a87f778a205
Untuk struktur catatan peristiwa yang dikembalikan dan deskripsi setiap bidang, lihat Catatan acara cluster di referensi peristiwa HyperPod cluster.
Mengotomatiskan tanggapan dengan Amazon EventBridge
HyperPod peristiwa cluster secara otomatis dikirim ke Amazon EventBridge di bawah jenis detailSageMaker HyperPod Cluster Event, memungkinkan Anda untuk merutekan peristiwa ke target seperti Lambda, Amazon SNS, Step Functions, atau Amazon SQS. Anda dapat memfilter di EventLevel bidang untuk memicu peringatan hanya untuk Error peristiwa, atau memfilter menurut ARN cluster ke aturan cakupan ke kluster tertentu.
Untuk pola EventBridge peristiwa, contoh payload, dan jenis terkait SageMaker
HyperPod Cluster State Change dan SageMaker HyperPod Cluster Node
Health Event detail, lihat EventBridge integrasi di referensi peristiwa HyperPod cluster.