SageMaker AI Insights OpenTelemetry 指标参考
本节提供了 SageMaker AI 详细可观测性所发出的 OpenTelemetry 指标的完整列表。详细的可观测性基于 OpenTelemetry(OTel)构建,从 GPU、节点和推理框架层收集精细的运营指标,并将其发布到 CloudWatch,附带丰富标签。
详细的可观测性通过 OTLP 向 CloudWatch 发布 OpenTelemetry(OTel)指标。这些不是 Prometheus 的指标。这些指标以 OTel 指标数据原生存储在 CloudWatch 中,可使用 PromQL 语法进行查询。
账户级别汇总指标
| 指标 | Type | 说明 |
TotalEndpoints | 聚合 | 账户中所有端点计数 |
TotalICs | 聚合 | 所有推理组件计数 |
TotalGPUs | 聚合 | 所有 GPU 计数(派生自 DCGM_FI_DEV_GPU_UTIL) |
端点级别指标
| 指标 | Type | 说明 |
InstanceCountPerEndpoint | 聚合 | 处理流量的实例计数 |
InstancesPerAZ | 聚合 | 每个可用区的实例数 |
EmptyInstanceCount | 聚合 | 未放置 IC 的实例数 |
ScalingAction | Raw | 扩缩事件(横向缩减/横向扩展) |
ICECount | Raw | 容量不足错误计数 |
CPUUtilization(EP) | 聚合 | 端点级别 CPU 利用率 |
MemoryUtilization(EP) | 聚合 | 端点级别内存利用率 |
DiskUtilization(EP) | 聚合 | 端点级别磁盘利用率 |
E2EScalingLatency | Raw | 端到端扩缩时长 |
RebalancingType | Raw | 再平衡事件的类型 |
RebalancingDuration | Raw | 再平衡时长(秒) |
RebalancingCopiesMoved | Raw | 再平衡期间移动的 IC 副本数 |
AZSkewDelta | Raw | AZ 分布不平衡 |
InstancesReleased | Raw | 通过再平衡释放的实例数 |
推理框架指标(vLLM/SGLang)
| 指标 | Type | 说明 |
InputTokensPerSecond | 聚合 | 输入令牌速率 |
OutputTokensPerSecond | 聚合 | 输出令牌速率 |
TotalTPS | 聚合 | 每秒令牌总数 |
TPSUtilization | 聚合 | TPS 利用率百分比 |
TTFT | Raw | 获得第一个令牌的时间(直方图) |
InterTokenLatency | Raw | 令牌间延迟(直方图) |
KVCacheUtilization | Raw | KV 缓存利用率百分比 |
QueueDepth | Raw | 等待中请求数(队列) |
BatchSize | Raw | 运行中请求数(在途) |
TPSPerInstance | 聚合 | 每个实例的 TPS 汇总 |
ConcurrentReqsPerCopy | Raw | 每个副本的在途请求数 |
FirstChunkLatencyPerIC | Raw | 每个 IC 的 TTFT |
4XXErrorRatePerIC | 聚合 | 每个 IC 的客户端错误数 |
5XXErrorRatePerIC | 聚合 | 每个 IC 的服务器错误数 |
TTFTPerIC | Raw | 由 IC 过滤的 TTFT |
ITLPerIC | Raw | 由 IC 过滤的 ITL |
InputTPSPerIC | 聚合 | 每个 IC 的输入 TPS |
OutputTPSPerIC | 聚合 | 每个 IC 的输出 TPS |
KVCachePerIC | Raw | 每个 IC 的 KV 缓存 |
ModelErrorBreakdown | 聚合 | 按类型进行的错误细分 |
TTFT 和 InterTokenLatency 依赖于框架,仅支持 vLLM 和 SGLang。
GPU(DCGM)指标
这些指标是从 NVIDIA 数据中心 GPU 管理器(DCGM)导出器收集的。无论推理框架如何,它们都可以在所有 GPU 端点上使用。
| 指标 | Type | 说明 |
DCGM_FI_DEV_GPU_UTIL | Raw | GPU 利用率(%) |
DCGM_FI_DEV_MEM_COPY_UTIL | Raw | 内存利用率(%) |
DCGM_FI_DEV_GPU_TEMP | Raw | GPU 温度(°C) |
DCGM_FI_DEV_MEMORY_TEMP | Raw | 内存温度(°C) |
DCGM_FI_DEV_FB_FREE | Raw | 空闲的帧缓冲区内存(字节) |
DCGM_FI_DEV_FB_USED | Raw | 已使用的帧缓冲区内存(字节) |
DCGM_FI_DEV_SM_ACTIVE | Raw | 活动的流式传输多处理器(%) |
节点(实例)指标
这些指标是从节点导出器收集的。它们提供了实例级的 CPU、内存和磁盘利用率的可见性。
| 指标 | Type | 说明 |
node_cpu_seconds_total | Raw | 每内核每模式的 CPU 时间(秒) |
node_memory_MemTotal_bytes | Raw | 总内存(字节) |
node_memory_MemAvailable_bytes | Raw | 可用内存(字节) |
node_filesystem_size_bytes | Raw | 文件系统总大小(字节) |
node_filesystem_avail_bytes | Raw | 文件系统可用空间(字节) |
HA 和 IC 放置指标
| 指标 | Type | 说明 |
ICCopyCountPerAZ | 聚合 | 每个 AZ 的 IC 副本数 |
ICCopiesPerAZ | 聚合 | 每个 AZ 的 IC 副本数(备选视图) |
AZSkewScore | 聚合 | 可用区不平衡分数 |
AZBalanceScore | 聚合 | 端点级别平衡 |
ICDensityPerAZ | 聚合 | 每个 AZ 的 IC 密度 |
ICCopiesPerInstance | 聚合 | 每个实例的 IC 副本数 |
ICListPerInstance | 聚合 | 哪些 IC 位于哪个实例上 |
生命周期和预置指标
| 指标 | Type | 说明 |
ModelDownloadTime | Raw | 从 Amazon S3 下载到实例的耗时 |
GPULoadTime | Raw | 权重加载至 GPU 显存的耗时 |
ContainerStartDuration | Raw | 容器开始运行状况检查的耗时 |
ColdStartDuration | Raw | 端到端:从创建到第一次调用的耗时 |
仅作为 CloudWatch 经典指标提供的指标
以下指标仅作为 CloudWatch 经典指标(命名空间和维度模型)提供,并且需要 OTel 充实功能才能显示为 OpenTelemetry 指标。
| 指标 | 备注 |
InvocationsPerIC | 禁止直接通过 OpenTelemetry 上报 |
InvocationsPerCopy | 阻止 |
ModelLatencyPerIC | 已阻止:请使用 vllm:e2e_request_latency_seconds 作为 OTel 替代方案 |
OverheadLatencyPerIC | 阻止 |
MidStreamErrorsPerIC | 已阻止(仅限双向流式传输) |