

本文為英文版的機器翻譯版本，如內容有任何歧義或不一致之處，概以英文版為準。

# SageMaker AI Insights OpenTelemetry 指標參考
<a name="SageMaker-AI-Insights-Metrics"></a>

本節提供 SageMaker AI 詳細可觀測性發出的 OpenTelemetry 指標完整清單。詳細的可觀測性是以 OpenTelemetry (OTel) 為基礎，並從 GPU、節點和推論架構層收集精細的操作指標，並使用豐富的標籤將其發佈至 CloudWatch。

**注意**  
詳細的可觀測性會透過 OTLP 將 OpenTelemetry (OTel) 指標發佈至 CloudWatch。這些不是 Prometheus 指標。這些指標以 OTel 指標資料的形式原生存放在 CloudWatch 中，並使用 PromQL 語法查詢。

## 帳戶層級彙總指標
<a name="SageMaker-AI-Insights-Metrics-account"></a>


| 指標 | Type | 說明 | 
| --- | --- | --- | 
| TotalEndpoints | Aggregate | 帳戶中所有端點的計數 | 
| TotalICs | Aggregate | 所有推論元件的計數 | 
| TotalGPUs | Aggregate | 所有 GPUs 的計數 （衍生自 DCGM\_FI\_DEV\_GPU\_UTIL) | 

## 端點層級指標
<a name="SageMaker-AI-Insights-Metrics-endpoint"></a>


| 指標 | Type | 說明 | 
| --- | --- | --- | 
| InstanceCountPerEndpoint | Aggregate | 提供流量的執行個體計數 | 
| InstancesPerAZ | Aggregate | 每個可用區域的執行個體 | 
| EmptyInstanceCount | Aggregate | 未放置 ICs執行個體 | 
| ScalingAction | Raw | 擴展事件 （輸入/輸出） | 
| ICECount | Raw | 容量不足錯誤計數 | 
| CPUUtilization (EP) | Aggregate | 端點層級 CPU 使用率 | 
| MemoryUtilization (EP) | Aggregate | 端點層級記憶體使用率 | 
| DiskUtilization (EP) | Aggregate | 端點層級磁碟使用率 | 
| E2EScalingLatency | Raw | End-to-end擴展持續時間 | 
| RebalancingType | Raw | 重新平衡事件的類型 | 
| RebalancingDuration | Raw | 重新平衡持續時間 （秒） | 
| RebalancingCopiesMoved | Raw | 在重新平衡期間移動的 IC 副本 | 
| AZSkewDelta | Raw | AZ 分佈不平衡 | 
| InstancesReleased | Raw | 透過重新平衡釋放的執行個體 | 

## 推論架構指標 (vLLM/SGLang)
<a name="SageMaker-AI-Insights-Metrics-framework"></a>


| 指標 | Type | 說明 | 
| --- | --- | --- | 
| InputTokensPerSecond | Aggregate | 輸入字符率 | 
| OutputTokensPerSecond | Aggregate | 輸出字符率 | 
| TotalTPS | Aggregate | 每秒字符總數 | 
| TPSUtilization | Aggregate | TPS 使用率百分比 | 
| TTFT | Raw | 首次字符的時間 （長條圖） | 
| InterTokenLatency | Raw | 權杖間延遲 （長條圖） | 
| KVCacheUtilization | Raw | KV 快取用量百分比 | 
| QueueDepth | Raw | 等待請求 （佇列） | 
| BatchSize | Raw | 執行中的請求 （進行中） | 
| TPSPerInstance | Aggregate | 每個執行個體彙總的 TPS | 
| ConcurrentReqsPerCopy | Raw | 每個複製的傳輸中請求 | 
| FirstChunkLatencyPerIC | Raw | 每個 IC 的 TTFT | 
| 4XXErrorRatePerIC | Aggregate | 每個 IC 的用戶端錯誤 | 
| 5XXErrorRatePerIC | Aggregate | 每個 IC 的伺服器錯誤 | 
| TTFTPerIC | Raw | 由 IC 篩選的 TTFT | 
| ITLPerIC | Raw | 依 IC 篩選的 ITL | 
| InputTPSPerIC | Aggregate | 每個 IC 的輸入 TPS | 
| OutputTPSPerIC | Aggregate | 每個 IC 的輸出 TPS | 
| KVCachePerIC | Raw | 每個 IC 的 KV 快取 | 
| ModelErrorBreakdown | Aggregate | 依類型分類的錯誤明細 | 

**注意**  
`TTFT` 和 `InterTokenLatency`取決於架構，僅支援 vLLM 和 SGLang。

## GPU (DCGM) 指標
<a name="SageMaker-AI-Insights-Metrics-gpu"></a>

這些指標是從 NVIDIA 資料中心 GPU Manager (DCGM) 匯出工具收集而來。無論推論架構為何，它們都可在所有 GPU 端點上使用。


| 指標 | Type | 說明 | 
| --- | --- | --- | 
| DCGM\_FI\_DEV\_GPU\_UTIL | Raw | GPU 使用率 (%) | 
| DCGM\_FI\_DEV\_MEM\_COPY\_UTIL | Raw | 記憶體複製使用率 (%) | 
| DCGM\_FI\_DEV\_GPU\_TEMP | Raw | GPU 溫度 (°C) | 
| DCGM\_FI\_DEV\_MEMORY\_TEMP | Raw | 記憶體溫度 (°C) | 
| DCGM\_FI\_DEV\_FB\_FREE | Raw | Framebuffer 記憶體可用 （位元組） | 
| DCGM\_FI\_DEV\_FB\_USED | Raw | 使用的影格緩衝記憶體 （位元組） | 
| DCGM\_FI\_DEV\_SM\_ACTIVE | Raw | 串流多處理器作用中 (%) | 

## 節點 （執行個體） 指標
<a name="SageMaker-AI-Insights-Metrics-node"></a>

這些指標會從節點匯出工具收集。它們提供 CPU、記憶體和磁碟使用率的執行個體層級可見性。


| 指標 | Type | 說明 | 
| --- | --- | --- | 
| node\_cpu\_seconds\_total | Raw | 每個核心每個模式的 CPU 時間 （秒） | 
| node\_memory\_MemTotal\_bytes | Raw | 總記憶體 （位元組） | 
| node\_memory\_MemAvailable\_bytes | Raw | 可用的記憶體 （位元組） | 
| node\_filesystem\_size\_bytes | Raw | 檔案系統總大小 （位元組） | 
| node\_filesystem\_avail\_bytes | Raw | 檔案系統可用空間 （位元組） | 

## HA 和 IC 置放指標
<a name="SageMaker-AI-Insights-Metrics-ha"></a>


| 指標 | Type | 說明 | 
| --- | --- | --- | 
| ICCopyCountPerAZ | Aggregate | 每個可用區域的 IC 副本 | 
| ICCopiesPerAZ | Aggregate | 每個可用區域的 IC 副本 （替代檢視） | 
| AZSkewScore | Aggregate | AZ 不平衡分數 | 
| AZBalanceScore | Aggregate | 端點層級平衡 | 
| ICDensityPerAZ | Aggregate | 每個可用區域的 IC 密度 | 
| ICCopiesPerInstance | Aggregate | 每個執行個體的 IC 副本 | 
| ICListPerInstance | Aggregate | 哪個執行個體上的ICs  | 

## 生命週期和佈建指標
<a name="SageMaker-AI-Insights-Metrics-lifecycle"></a>


| 指標 | Type | 說明 | 
| --- | --- | --- | 
| ModelDownloadTime | Raw | Amazon S3 執行個體下載的時間 | 
| GPULoadTime | Raw | GPU 記憶體的權重時間 | 
| ContainerStartDuration | Raw | 容器開始運作狀態檢查 | 
| ColdStartDuration | Raw | End-to-end：建立至第一次調用 | 

## 指標僅適用於 CloudWatch 傳統指標
<a name="SageMaker-AI-Insights-Metrics-classic"></a>

下列指標僅適用於 CloudWatch 傳統指標 （命名空間和維度模型），並要求 OTel 擴充顯示為 OpenTelemetry 指標。


| 指標 | 備註 | 
| --- | --- | 
| InvocationsPerIC | 封鎖直接 OpenTelemetry 發射 | 
| InvocationsPerCopy | 封鎖 | 
| ModelLatencyPerIC | 封鎖 - 使用 vllm:e2e\_request\_latency\_seconds作為 OTel 替代方案 | 
| OverheadLatencyPerIC | 封鎖 | 
| MidStreamErrorsPerIC | 封鎖 （僅限雙向串流） | 