Las traducciones son generadas a través de traducción automática. En caso de conflicto entre la traducción y la version original de inglés, prevalecerá la version en inglés.
SageMaker HyperPod Eventos del clúster Slurm
Amazon SageMaker HyperPod emite eventos de clúster estructurados que proporcionan visibilidad de los cambios operativos a nivel de clúster, grupo de instancias e instancia. Puede usar estos eventos para monitorear la actividad de aprovisionamiento, realizar un seguimiento de las operaciones de escalado, detectar fallas y crear canalizaciones de alertas automatizadas.
Los eventos de clúster están disponibles para los clústeres de HyperPod Slurm con el valor establecido en. NodeProvisioningMode Continuous Se puede acceder a los ListClusterEvents eventos a través de DescribeClusterEvent las API, la consola de SageMaker IA y Amazon EventBridge.
Para ver el esquema completo de eventos, los niveles de gravedad, el catálogo completo de eventos y los detalles de EventBridge integración, consulteSageMaker HyperPod referencia de eventos del clúster.
Requisitos previos
-
Su clúster de HyperPod Slurm debe estar
NodeProvisioningModeconfigurado en.ContinuousLos clústeres que utilizan el modo de aprovisionamiento tradicional no emiten eventos estructurados. -
Para usar la API, necesitas tener
sagemaker:ListClusterEventssagemaker:DescribeClusterEventpermisos en tu política de IAM.
Event types (Tipos de eventos)
HyperPod Emite dos categorías de eventos para los clústeres de Slurm en el aprovisionamiento continuo: eventos comunes que se aplican a todos los orquestadores y eventos. Slurm-specific
Los eventos más comunes abarcan las operaciones de la infraestructura principal, como el aprovisionamiento y la terminación de instancias, el escalado de grupos de instancias, la gestión de reservas de capacidad, la ejecución de scripts del ciclo de vida, la administración de ENI, el ciclo de vida del sistema de archivos FSx y los flujos de trabajo de parcheo. Para ver la lista completa, consulte la referencia de eventos del Eventos comunes (EKS y Slurm) clúster. HyperPod
Slurm-specific los eventos cubren operaciones específicas del orquestador, como la validación de parámetros de aprovisionamiento, la creación de claves munge, la detección de desviaciones de configuración de Slurm, la reconfiguración de Slurm y la reversión de clústeres. Estos eventos proporcionan visibilidad de las etapas del ciclo de vida que antes solo se podían observar mediante registros. Slurm-specific CloudWatch Para ver la lista completa, consulte Slurm-specific eventos la referencia de eventos del HyperPod clúster.
Visualización de eventos en la consola
-
Abre la consola de SageMaker IA
. -
En el panel de navegación izquierdo, selecciona HyperPodclústeres.
-
Elige el nombre del clúster.
-
Seleccione la pestaña Eventos.
La pestaña Eventos muestra una lista paginada de eventos con columnas para el nivel del evento, el identificador del evento, el nombre del recurso, el tipo de recurso, la descripción y la hora del evento. Puede filtrar los eventos por atributo mediante el cuadro de búsqueda, ordenar por hora del evento y elegir un ID de evento para ver todos los detalles del evento, incluidos los metadatos del evento y el registro completo del evento.
Para enumerar los eventos, utilice el AWS CLI
Utilice el list-cluster-events comando para recuperar los eventos de su clúster:
aws sagemaker list-cluster-events \ --cluster-name my-slurm-cluster \ --sort-by EventTime \ --sort-order Descending \ --max-results 20
Puede restringir los resultados mediante los siguientes filtros:
-
--resource-type— filtrar porClusterInstanceGroup, oInstance. -
--instance-group-name— filtrar los eventos de un grupo de instancias específico. -
--node-id— filtrar los eventos de una instancia EC2 específica. -
--event-time-aftery--event-time-before— filtra según un intervalo de tiempo específico.
Por ejemplo, para ver solo los eventos a nivel de grupo de instancias de un grupo de instancias específico:
aws sagemaker list-cluster-events \ --cluster-name my-slurm-cluster \ --resource-type InstanceGroup \ --instance-group-name gpu-workers
Describir un evento específico
Utilice el describe-cluster-event comando con un identificador de evento del resultado de la lista para recuperar todos los detalles del evento, incluidos los EventLevel valoresDescription, yEventMetadata:
aws sagemaker describe-cluster-event \ --cluster-name my-slurm-cluster \ --event-id 83ea0bb5-be77-45e8-a458-0a87f778a205
Para ver la estructura del registro de eventos devuelto y una descripción de cada campo, consulte Registro de eventos del clúster la referencia de eventos del HyperPod clúster.
Automatizar las respuestas con Amazon EventBridge
HyperPod los eventos de clúster se envían automáticamente a Amazon EventBridge con el tipo de detalleSageMaker HyperPod Cluster Event, lo que le permite enrutar los eventos a destinos como Lambda, Amazon SNS, Step Functions o Amazon SQS. Puede filtrar en el EventLevel campo para activar alertas solo para Error eventos o filtrar por ARN de clúster para limitar las reglas a un clúster específico.
Para ver los patrones de EventBridge eventos, los ejemplos de carga útil y los tipos relacionados SageMaker
HyperPod Cluster State Change y SageMaker HyperPod Cluster Node
Health Event detallados, consulte la referencia EventBridge integración de eventos del HyperPod clúster.