本文為英文版的機器翻譯版本,如內容有任何歧義或不一致之處,概以英文版為準。
SageMaker AI Insights OpenTelemetry 指標參考
本節提供 SageMaker AI 詳細可觀測性發出的 OpenTelemetry 指標完整清單。詳細的可觀測性是以 OpenTelemetry (OTel) 為基礎,並從 GPU、節點和推論架構層收集精細的操作指標,並使用豐富的標籤將其發佈至 CloudWatch。
詳細的可觀測性會透過 OTLP 將 OpenTelemetry (OTel) 指標發佈至 CloudWatch。這些不是 Prometheus 指標。這些指標以 OTel 指標資料的形式原生存放在 CloudWatch 中,並使用 PromQL 語法查詢。
帳戶層級彙總指標
| 指標 | Type | 說明 |
TotalEndpoints | Aggregate | 帳戶中所有端點的計數 |
TotalICs | Aggregate | 所有推論元件的計數 |
TotalGPUs | Aggregate | 所有 GPUs 的計數 (衍生自 DCGM_FI_DEV_GPU_UTIL) |
端點層級指標
| 指標 | Type | 說明 |
InstanceCountPerEndpoint | Aggregate | 提供流量的執行個體計數 |
InstancesPerAZ | Aggregate | 每個可用區域的執行個體 |
EmptyInstanceCount | Aggregate | 未放置 ICs執行個體 |
ScalingAction | Raw | 擴展事件 (輸入/輸出) |
ICECount | Raw | 容量不足錯誤計數 |
CPUUtilization (EP) | Aggregate | 端點層級 CPU 使用率 |
MemoryUtilization (EP) | Aggregate | 端點層級記憶體使用率 |
DiskUtilization (EP) | Aggregate | 端點層級磁碟使用率 |
E2EScalingLatency | Raw | End-to-end擴展持續時間 |
RebalancingType | Raw | 重新平衡事件的類型 |
RebalancingDuration | Raw | 重新平衡持續時間 (秒) |
RebalancingCopiesMoved | Raw | 在重新平衡期間移動的 IC 副本 |
AZSkewDelta | Raw | AZ 分佈不平衡 |
InstancesReleased | Raw | 透過重新平衡釋放的執行個體 |
推論架構指標 (vLLM/SGLang)
| 指標 | Type | 說明 |
InputTokensPerSecond | Aggregate | 輸入字符率 |
OutputTokensPerSecond | Aggregate | 輸出字符率 |
TotalTPS | Aggregate | 每秒字符總數 |
TPSUtilization | Aggregate | TPS 使用率百分比 |
TTFT | Raw | 首次字符的時間 (長條圖) |
InterTokenLatency | Raw | 權杖間延遲 (長條圖) |
KVCacheUtilization | Raw | KV 快取用量百分比 |
QueueDepth | Raw | 等待請求 (佇列) |
BatchSize | Raw | 執行中的請求 (進行中) |
TPSPerInstance | Aggregate | 每個執行個體彙總的 TPS |
ConcurrentReqsPerCopy | Raw | 每個複製的傳輸中請求 |
FirstChunkLatencyPerIC | Raw | 每個 IC 的 TTFT |
4XXErrorRatePerIC | Aggregate | 每個 IC 的用戶端錯誤 |
5XXErrorRatePerIC | Aggregate | 每個 IC 的伺服器錯誤 |
TTFTPerIC | Raw | 由 IC 篩選的 TTFT |
ITLPerIC | Raw | 依 IC 篩選的 ITL |
InputTPSPerIC | Aggregate | 每個 IC 的輸入 TPS |
OutputTPSPerIC | Aggregate | 每個 IC 的輸出 TPS |
KVCachePerIC | Raw | 每個 IC 的 KV 快取 |
ModelErrorBreakdown | Aggregate | 依類型分類的錯誤明細 |
TTFT 和 InterTokenLatency取決於架構,僅支援 vLLM 和 SGLang。
GPU (DCGM) 指標
這些指標是從 NVIDIA 資料中心 GPU Manager (DCGM) 匯出工具收集而來。無論推論架構為何,它們都可在所有 GPU 端點上使用。
| 指標 | Type | 說明 |
DCGM_FI_DEV_GPU_UTIL | Raw | GPU 使用率 (%) |
DCGM_FI_DEV_MEM_COPY_UTIL | Raw | 記憶體複製使用率 (%) |
DCGM_FI_DEV_GPU_TEMP | Raw | GPU 溫度 (°C) |
DCGM_FI_DEV_MEMORY_TEMP | Raw | 記憶體溫度 (°C) |
DCGM_FI_DEV_FB_FREE | Raw | Framebuffer 記憶體可用 (位元組) |
DCGM_FI_DEV_FB_USED | Raw | 使用的影格緩衝記憶體 (位元組) |
DCGM_FI_DEV_SM_ACTIVE | Raw | 串流多處理器作用中 (%) |
節點 (執行個體) 指標
這些指標會從節點匯出工具收集。它們提供 CPU、記憶體和磁碟使用率的執行個體層級可見性。
| 指標 | Type | 說明 |
node_cpu_seconds_total | Raw | 每個核心每個模式的 CPU 時間 (秒) |
node_memory_MemTotal_bytes | Raw | 總記憶體 (位元組) |
node_memory_MemAvailable_bytes | Raw | 可用的記憶體 (位元組) |
node_filesystem_size_bytes | Raw | 檔案系統總大小 (位元組) |
node_filesystem_avail_bytes | Raw | 檔案系統可用空間 (位元組) |
HA 和 IC 置放指標
| 指標 | Type | 說明 |
ICCopyCountPerAZ | Aggregate | 每個可用區域的 IC 副本 |
ICCopiesPerAZ | Aggregate | 每個可用區域的 IC 副本 (替代檢視) |
AZSkewScore | Aggregate | AZ 不平衡分數 |
AZBalanceScore | Aggregate | 端點層級平衡 |
ICDensityPerAZ | Aggregate | 每個可用區域的 IC 密度 |
ICCopiesPerInstance | Aggregate | 每個執行個體的 IC 副本 |
ICListPerInstance | Aggregate | 哪個執行個體上的ICs |
生命週期和佈建指標
| 指標 | Type | 說明 |
ModelDownloadTime | Raw | Amazon S3 執行個體下載的時間 |
GPULoadTime | Raw | GPU 記憶體的權重時間 |
ContainerStartDuration | Raw | 容器開始運作狀態檢查 |
ColdStartDuration | Raw | End-to-end:建立至第一次調用 |
指標僅適用於 CloudWatch 傳統指標
下列指標僅適用於 CloudWatch 傳統指標 (命名空間和維度模型),並要求 OTel 擴充顯示為 OpenTelemetry 指標。
| 指標 | 備註 |
InvocationsPerIC | 封鎖直接 OpenTelemetry 發射 |
InvocationsPerCopy | 封鎖 |
ModelLatencyPerIC | 封鎖 - 使用 vllm:e2e_request_latency_seconds作為 OTel 替代方案 |
OverheadLatencyPerIC | 封鎖 |
MidStreamErrorsPerIC | 封鎖 (僅限雙向串流) |