View a markdown version of this page

SageMaker AI Insights OpenTelemetry 指标参考 - Amazon CloudWatch

SageMaker AI Insights OpenTelemetry 指标参考

本节提供了 SageMaker AI 详细可观测性所发出的 OpenTelemetry 指标的完整列表。详细的可观测性基于 OpenTelemetry(OTel)构建,从 GPU、节点和推理框架层收集精细的运营指标,并将其发布到 CloudWatch,附带丰富标签。

注意

详细的可观测性通过 OTLP 向 CloudWatch 发布 OpenTelemetry(OTel)指标。这些不是 Prometheus 的指标。这些指标以 OTel 指标数据原生存储在 CloudWatch 中,可使用 PromQL 语法进行查询。

账户级别汇总指标

指标Type说明
TotalEndpoints聚合账户中所有端点计数
TotalICs聚合所有推理组件计数
TotalGPUs聚合所有 GPU 计数(派生自 DCGM_FI_DEV_GPU_UTIL

端点级别指标

指标Type说明
InstanceCountPerEndpoint聚合处理流量的实例计数
InstancesPerAZ聚合每个可用区的实例数
EmptyInstanceCount聚合未放置 IC 的实例数
ScalingActionRaw扩缩事件(横向缩减/横向扩展)
ICECountRaw容量不足错误计数
CPUUtilization(EP)聚合端点级别 CPU 利用率
MemoryUtilization(EP)聚合端点级别内存利用率
DiskUtilization(EP)聚合端点级别磁盘利用率
E2EScalingLatencyRaw端到端扩缩时长
RebalancingTypeRaw再平衡事件的类型
RebalancingDurationRaw再平衡时长(秒)
RebalancingCopiesMovedRaw再平衡期间移动的 IC 副本数
AZSkewDeltaRawAZ 分布不平衡
InstancesReleasedRaw通过再平衡释放的实例数

推理框架指标(vLLM/SGLang)

指标Type说明
InputTokensPerSecond聚合输入令牌速率
OutputTokensPerSecond聚合输出令牌速率
TotalTPS聚合每秒令牌总数
TPSUtilization聚合TPS 利用率百分比
TTFTRaw获得第一个令牌的时间(直方图)
InterTokenLatencyRaw令牌间延迟(直方图)
KVCacheUtilizationRawKV 缓存利用率百分比
QueueDepthRaw等待中请求数(队列)
BatchSizeRaw运行中请求数(在途)
TPSPerInstance聚合每个实例的 TPS 汇总
ConcurrentReqsPerCopyRaw每个副本的在途请求数
FirstChunkLatencyPerICRaw每个 IC 的 TTFT
4XXErrorRatePerIC聚合每个 IC 的客户端错误数
5XXErrorRatePerIC聚合每个 IC 的服务器错误数
TTFTPerICRaw由 IC 过滤的 TTFT
ITLPerICRaw由 IC 过滤的 ITL
InputTPSPerIC聚合每个 IC 的输入 TPS
OutputTPSPerIC聚合每个 IC 的输出 TPS
KVCachePerICRaw每个 IC 的 KV 缓存
ModelErrorBreakdown聚合按类型进行的错误细分
注意

TTFTInterTokenLatency 依赖于框架,仅支持 vLLM 和 SGLang。

GPU(DCGM)指标

这些指标是从 NVIDIA 数据中心 GPU 管理器(DCGM)导出器收集的。无论推理框架如何,它们都可以在所有 GPU 端点上使用。

指标Type说明
DCGM_FI_DEV_GPU_UTILRawGPU 利用率(%)
DCGM_FI_DEV_MEM_COPY_UTILRaw内存利用率(%)
DCGM_FI_DEV_GPU_TEMPRawGPU 温度(°C)
DCGM_FI_DEV_MEMORY_TEMPRaw内存温度(°C)
DCGM_FI_DEV_FB_FREERaw空闲的帧缓冲区内存(字节)
DCGM_FI_DEV_FB_USEDRaw已使用的帧缓冲区内存(字节)
DCGM_FI_DEV_SM_ACTIVERaw活动的流式传输多处理器(%)

节点(实例)指标

这些指标是从节点导出器收集的。它们提供了实例级的 CPU、内存和磁盘利用率的可见性。

指标Type说明
node_cpu_seconds_totalRaw每内核每模式的 CPU 时间(秒)
node_memory_MemTotal_bytesRaw总内存(字节)
node_memory_MemAvailable_bytesRaw可用内存(字节)
node_filesystem_size_bytesRaw文件系统总大小(字节)
node_filesystem_avail_bytesRaw文件系统可用空间(字节)

HA 和 IC 放置指标

指标Type说明
ICCopyCountPerAZ聚合每个 AZ 的 IC 副本数
ICCopiesPerAZ聚合每个 AZ 的 IC 副本数(备选视图)
AZSkewScore聚合可用区不平衡分数
AZBalanceScore聚合端点级别平衡
ICDensityPerAZ聚合每个 AZ 的 IC 密度
ICCopiesPerInstance聚合每个实例的 IC 副本数
ICListPerInstance聚合哪些 IC 位于哪个实例上

生命周期和预置指标

指标Type说明
ModelDownloadTimeRaw从 Amazon S3 下载到实例的耗时
GPULoadTimeRaw权重加载至 GPU 显存的耗时
ContainerStartDurationRaw容器开始运行状况检查的耗时
ColdStartDurationRaw端到端:从创建到第一次调用的耗时

仅作为 CloudWatch 经典指标提供的指标

以下指标仅作为 CloudWatch 经典指标(命名空间和维度模型)提供,并且需要 OTel 充实功能才能显示为 OpenTelemetry 指标。

指标备注
InvocationsPerIC禁止直接通过 OpenTelemetry 上报
InvocationsPerCopy阻止
ModelLatencyPerIC已阻止:请使用 vllm:e2e_request_latency_seconds 作为 OTel 替代方案
OverheadLatencyPerIC阻止
MidStreamErrorsPerIC已阻止(仅限双向流式传输)