

本文属于机器翻译版本。若本译文内容与英语原文存在差异，则一律以英文原文为准。

# SageMaker HyperPod EKS 集群事件
<a name="sagemaker-hyperpod-cluster-events-eks-page"></a>

Amazon 会 SageMaker HyperPod 发出结构化集群事件，让人们能够了解集群、实例组和实例级别的操作变化。您可以使用这些事件来监控配置活动、跟踪扩展操作、检测故障和构建自动警报管道。

集群事件适用于设置为 HyperPod 的 EKS `NodeProvisioningMode` 集群`Continuous`。事件可通过`ListClusterEvents`和 `DescribeClusterEvent` API、 SageMaker AI 控制台和 Amazon 进行访问 EventBridge。

有关完整的事件架构、严重性级别、完整的事件目录和 EventBridge集成的详细信息，请参阅[SageMaker HyperPod 集群事件参考](sagemaker-hyperpod-cluster-events-reference.md)。

## 先决条件
<a name="sagemaker-hyperpod-cluster-events-eks-prereqs"></a>
+ 您的 HyperPod EKS 集群必须已`NodeProvisioningMode`设置为`Continuous`。使用传统配置模式的集群不会发出结构化事件。
+ 要使用 API，您需要在您的 IAM 策略中`sagemaker:DescribeClusterEvent`拥有`sagemaker:ListClusterEvents`和权限。

## 事件类型
<a name="sagemaker-hyperpod-cluster-events-eks-types"></a>

HyperPod 在持续配置时为 EKS 集群发出两类事件：适用于所有协调器的常见事件和事件。 EKS-specific

**常见事件**包括核心基础设施操作，例如实例配置和终止、实例组扩展、容量预留处理、生命周期脚本执行、ENI 管理、FSx 文件系统生命周期和修补工作流程。有关完整列表，请参阅 HyperPod 集群事件参考[常见事件（EKS 和 Slurm）](sagemaker-hyperpod-cluster-events-reference.md#sagemaker-hyperpod-cluster-events-common)中的。

**EKS-specific 事件**涵盖特定于编排器的操作，例如 EKS 访问条目管理、Kubernetes 配置更新（标签和污点）、Karpenter 自动缩放生命周期、吊舱驱逐和修补期间，以及具有自动回滚功能的烘焙时间警报监控。 cordon/uncordon 这些事件提供了对 EKS-specific 生命周期阶段的可见性，而这些阶段以前只能通过 CloudWatch 日志进行观察。有关完整列表，请参阅 HyperPod 集群事件参考[EKS-specific 事件](sagemaker-hyperpod-cluster-events-reference.md#sagemaker-hyperpod-cluster-events-eks)中的。

## 在控制台中查看事件
<a name="sagemaker-hyperpod-cluster-events-eks-console"></a>

1. 打开 A [SageMaker I 控制台](https://console.aws.amazon.com/sagemaker)。

1. 在左侧导航窗格中，选择**HyperPod集群**。

1. 选择您的集群名称。

1. 选择**事件**选项卡。

“**事件**” 选项卡显示分页的事件列表，其中包含事件级别、事件 ID、资源名称、资源类型、描述和事件时间列。您可以使用搜索框按属性筛选事件，按事件时间排序，然后选择事件 ID 以查看完整的事件详细信息，包括事件元数据和完整的事件记录。

## 使用列出事件 AWS CLI
<a name="sagemaker-hyperpod-cluster-events-eks-cli"></a>

使用`list-cluster-events`命令检索集群的事件：

```
aws sagemaker list-cluster-events \
    --cluster-name my-eks-cluster \
    --sort-by EventTime \
    --sort-order Descending \
    --max-results 20
```

您可以使用以下筛选器缩小结果范围：
+ `--resource-type`— 按`Cluster``InstanceGroup`、或筛选`Instance`。
+ `--instance-group-name`— 筛选特定实例组的事件。
+ `--node-id`— 筛选到特定 EC2 实例的事件。
+ `--event-time-after`和 `--event-time-before` — 筛选到特定的时间窗口。

例如，要仅查看特定实例组的实例组级别事件，请执行以下操作：

```
aws sagemaker list-cluster-events \
    --cluster-name my-eks-cluster \
    --resource-type InstanceGroup \
    --instance-group-name gpu-workers
```

## 描述特定事件
<a name="sagemaker-hyperpod-cluster-events-eks-describe"></a>

使用带有列表输出中事件 ID 的`describe-cluster-event`命令来检索完整的事件详细信息`EventLevel`，包括`Description`、和`EventMetadata`：

```
aws sagemaker describe-cluster-event \
    --cluster-name my-eks-cluster \
    --event-id 83ea0bb5-be77-45e8-a458-0a87f778a205
```

有关返回的事件记录的结构和每个字段的描述，请参阅 HyperPod 集群事件参考[集群事件记录](sagemaker-hyperpod-cluster-events-reference.md#sagemaker-hyperpod-cluster-events-record)中的。

## 使用 Amazon 自动回复 EventBridge
<a name="sagemaker-hyperpod-cluster-events-eks-eventbridge"></a>

HyperPod 集群事件会以详细信息类型自动发送到亚马逊 EventBridge `SageMaker HyperPod Cluster Event`，使您能够将事件路由到目标，例如 Lambda、Amazon SNS、Step Functions 或 Amazon SQS。您可以对该`EventLevel`字段进行筛选以仅触发`Error`事件警报，也可以按集群 ARN 进行筛选，将规则范围限定为特定集群。

有关 EventBridge 事件模式、有效负载示例以及相关类型`SageMaker HyperPod Cluster State Change`和`SageMaker HyperPod Cluster Node Health Event`详细信息类型，请参阅 HyperPod 集群事件参考[EventBridge 整合](sagemaker-hyperpod-cluster-events-reference.md#sagemaker-hyperpod-cluster-events-eventbridge)中的。

## 相关主题
<a name="sagemaker-hyperpod-cluster-events-eks-related"></a>
+ [SageMaker HyperPod 集群事件参考](sagemaker-hyperpod-cluster-events-reference.md)
+ [亚马逊 A SageMaker I 发送给亚马逊的事件 EventBridge](https://docs.aws.amazon.com/sagemaker/latest/dg/automating-sagemaker-with-eventbridge.html)