View a markdown version of this page

SageMaker AI Insights OpenTelemetry 指標參考 - Amazon CloudWatch

本文為英文版的機器翻譯版本,如內容有任何歧義或不一致之處,概以英文版為準。

SageMaker AI Insights OpenTelemetry 指標參考

本節提供 SageMaker AI 詳細可觀測性發出的 OpenTelemetry 指標完整清單。詳細的可觀測性是以 OpenTelemetry (OTel) 為基礎,並從 GPU、節點和推論架構層收集精細的操作指標,並使用豐富的標籤將其發佈至 CloudWatch。

注意

詳細的可觀測性會透過 OTLP 將 OpenTelemetry (OTel) 指標發佈至 CloudWatch。這些不是 Prometheus 指標。這些指標以 OTel 指標資料的形式原生存放在 CloudWatch 中,並使用 PromQL 語法查詢。

帳戶層級彙總指標

指標Type說明
TotalEndpointsAggregate帳戶中所有端點的計數
TotalICsAggregate所有推論元件的計數
TotalGPUsAggregate所有 GPUs 的計數 (衍生自 DCGM_FI_DEV_GPU_UTIL)

端點層級指標

指標Type說明
InstanceCountPerEndpointAggregate提供流量的執行個體計數
InstancesPerAZAggregate每個可用區域的執行個體
EmptyInstanceCountAggregate未放置 ICs執行個體
ScalingActionRaw擴展事件 (輸入/輸出)
ICECountRaw容量不足錯誤計數
CPUUtilization (EP)Aggregate端點層級 CPU 使用率
MemoryUtilization (EP)Aggregate端點層級記憶體使用率
DiskUtilization (EP)Aggregate端點層級磁碟使用率
E2EScalingLatencyRawEnd-to-end擴展持續時間
RebalancingTypeRaw重新平衡事件的類型
RebalancingDurationRaw重新平衡持續時間 (秒)
RebalancingCopiesMovedRaw在重新平衡期間移動的 IC 副本
AZSkewDeltaRawAZ 分佈不平衡
InstancesReleasedRaw透過重新平衡釋放的執行個體

推論架構指標 (vLLM/SGLang)

指標Type說明
InputTokensPerSecondAggregate輸入字符率
OutputTokensPerSecondAggregate輸出字符率
TotalTPSAggregate每秒字符總數
TPSUtilizationAggregateTPS 使用率百分比
TTFTRaw首次字符的時間 (長條圖)
InterTokenLatencyRaw權杖間延遲 (長條圖)
KVCacheUtilizationRawKV 快取用量百分比
QueueDepthRaw等待請求 (佇列)
BatchSizeRaw執行中的請求 (進行中)
TPSPerInstanceAggregate每個執行個體彙總的 TPS
ConcurrentReqsPerCopyRaw每個複製的傳輸中請求
FirstChunkLatencyPerICRaw每個 IC 的 TTFT
4XXErrorRatePerICAggregate每個 IC 的用戶端錯誤
5XXErrorRatePerICAggregate每個 IC 的伺服器錯誤
TTFTPerICRaw由 IC 篩選的 TTFT
ITLPerICRaw依 IC 篩選的 ITL
InputTPSPerICAggregate每個 IC 的輸入 TPS
OutputTPSPerICAggregate每個 IC 的輸出 TPS
KVCachePerICRaw每個 IC 的 KV 快取
ModelErrorBreakdownAggregate依類型分類的錯誤明細
注意

TTFTInterTokenLatency取決於架構,僅支援 vLLM 和 SGLang。

GPU (DCGM) 指標

這些指標是從 NVIDIA 資料中心 GPU Manager (DCGM) 匯出工具收集而來。無論推論架構為何,它們都可在所有 GPU 端點上使用。

指標Type說明
DCGM_FI_DEV_GPU_UTILRawGPU 使用率 (%)
DCGM_FI_DEV_MEM_COPY_UTILRaw記憶體複製使用率 (%)
DCGM_FI_DEV_GPU_TEMPRawGPU 溫度 (°C)
DCGM_FI_DEV_MEMORY_TEMPRaw記憶體溫度 (°C)
DCGM_FI_DEV_FB_FREERawFramebuffer 記憶體可用 (位元組)
DCGM_FI_DEV_FB_USEDRaw使用的影格緩衝記憶體 (位元組)
DCGM_FI_DEV_SM_ACTIVERaw串流多處理器作用中 (%)

節點 (執行個體) 指標

這些指標會從節點匯出工具收集。它們提供 CPU、記憶體和磁碟使用率的執行個體層級可見性。

指標Type說明
node_cpu_seconds_totalRaw每個核心每個模式的 CPU 時間 (秒)
node_memory_MemTotal_bytesRaw總記憶體 (位元組)
node_memory_MemAvailable_bytesRaw可用的記憶體 (位元組)
node_filesystem_size_bytesRaw檔案系統總大小 (位元組)
node_filesystem_avail_bytesRaw檔案系統可用空間 (位元組)

HA 和 IC 置放指標

指標Type說明
ICCopyCountPerAZAggregate每個可用區域的 IC 副本
ICCopiesPerAZAggregate每個可用區域的 IC 副本 (替代檢視)
AZSkewScoreAggregateAZ 不平衡分數
AZBalanceScoreAggregate端點層級平衡
ICDensityPerAZAggregate每個可用區域的 IC 密度
ICCopiesPerInstanceAggregate每個執行個體的 IC 副本
ICListPerInstanceAggregate哪個執行個體上的ICs

生命週期和佈建指標

指標Type說明
ModelDownloadTimeRawAmazon S3 執行個體下載的時間
GPULoadTimeRawGPU 記憶體的權重時間
ContainerStartDurationRaw容器開始運作狀態檢查
ColdStartDurationRawEnd-to-end:建立至第一次調用

指標僅適用於 CloudWatch 傳統指標

下列指標僅適用於 CloudWatch 傳統指標 (命名空間和維度模型),並要求 OTel 擴充顯示為 OpenTelemetry 指標。

指標備註
InvocationsPerIC封鎖直接 OpenTelemetry 發射
InvocationsPerCopy封鎖
ModelLatencyPerIC封鎖 - 使用 vllm:e2e_request_latency_seconds作為 OTel 替代方案
OverheadLatencyPerIC封鎖
MidStreamErrorsPerIC封鎖 (僅限雙向串流)