View a markdown version of this page

SageMaker AI Insights 儀表板 - Amazon CloudWatch

本文為英文版的機器翻譯版本,如內容有任何歧義或不一致之處,概以英文版為準。

SageMaker AI Insights 儀表板

SageMaker AI Insights 儀表板分為三個標籤:效能容量可靠性。每個索引標籤都會提供推論端點運作狀態的重點檢視。

儀表板配置

摘要列

儀表板頂端的摘要列會顯示整個機群的總計。

SageMaker AI Insights 儀表板標頭具有摘要列,顯示調用、執行個體、推論元件和平均可用區域扭曲。
指標說明
調用所選時間範圍內所有端點的調用總數
執行個體目前為流量提供服務的執行個體總數
推論元件所有端點的推論元件總數
平均可用區域偏斜平均可用區域分佈不平衡 (0% = 完美平衡)

篩選條件面板

篩選條件說明
Endpoint為機群檢視選取特定端點或所有端點
執行個體選取特定執行個體 (需要先選取端點)
推論元件選取特定 IC 進行精細篩選

向下切入

SageMaker AI Insights 支援漸進式向下切入。

  1. 機群層級 (預設) - 所有端點可見、彙總摘要指標

  2. 端點層級 - 從篩選面板中選取端點,或在任何資料表中選擇端點連結

  3. IC 層級 - 從篩選面板中選取推論元件

使用 SageMaker AI 主控台進行交叉連結

  • 選擇端點名稱,以在 SageMaker AI 主控台中開啟端點詳細資訊頁面。

  • 選擇檢視日誌以開啟篩選至該端點或 IC 的 CloudWatch Logs。

  • 從 SageMaker AI 主控台中,針對每個 IC 資料列選擇在 SageMaker AI Insights 或指標中檢視

存取儀表板

您可以從 主控台的多個位置存取 SageMaker AI Insights 儀表板。

  • 從端點清單頁面:選擇在 SageMaker AI Insights 中檢視,在未套用篩選條件的機群層級開啟儀表板。

    端點清單頁面,顯示在 SageMaker AI Insights 中檢視按鈕。
  • 從端點詳細資訊頁面:選擇在 SageMaker AI Insights 中檢視,以開啟篩選至該端點的儀表板。

    端點詳細資訊頁面顯示在 SageMaker AI Insights 中檢視按鈕。
  • 從推論元件詳細資訊頁面:選擇在 SageMaker AI Insights 中檢視,以開啟篩選至該端點和推論元件的儀表板。

    顯示在 SageMaker AI Insights 中檢視按鈕的推論元件詳細資訊頁面。
  • 直接導覽:CloudWatch 主控台 → 基礎設施監控SageMaker AI Insights

效能索引標籤

效能索引標籤回答「運作狀態良好嗎?」 和「為什麼速度變慢?」—從頂端的機群整體運作狀態流動到底部的每個 IC 診斷。

效能運作狀態

依可用區域分組的 Honeycombs 可快速顯示執行個體、IC 複本和端點的警示狀態。

顯示 AZ 警示狀態的效能運作狀態 Honeycomb。
執行個體效能資料表

每個執行個體明細顯示 TTFT (P50/P99)、輸出 TPS (avg/max)、並行請求 (live/max) 和 KV 快取使用率。

顯示 TTFT、輸出 TPS、並行請求和 KV 快取的執行個體效能資料表。
權杖串流

時間序列圖表顯示具有 P50/P99 切換的 TTFT 和金鑰間延遲 (ITL),依架構細分。

權杖串流圖表顯示隨時間變化的 TTFT 和 ITL P50/P99。
字符輸送量

依架構的每秒輸入和輸出字符,具有輸入/輸出、百分位數和依執行個體檢視的切換。

權杖輸送量圖表顯示每秒的輸入和輸出權杖。
引擎和請求壓力

隨著時間的推移,KV 快取使用率 (%)、執行中的請求和等待請求 - 推論引擎的關鍵飽和訊號。

引擎和請求壓力面板,顯示 KV 快取、執行中的請求和等待中的請求。
流量分佈

每個執行個體或每個 IC 複製資料表顯示每分鐘調用、4XX 速率和 5XX 速率,以識別路由不平衡。

流量分佈表顯示每分鐘的調用、4XX 速率和執行個體的 5XX 速率。
隨著時間的推移,錯誤混合

折線圖顯示每個 IC 隨時間變化的 4XX、5XX 和中串流錯誤率。

時間線圖的錯誤混合顯示 4XX、5XX 和中串流錯誤。
隨著時間的推移,延遲明細

具有調用標籤 (模型延遲 + 額外負荷延遲) 和串流 (第一個區塊模型 + 第一個區塊額外負荷) 的堆疊區域圖,搭配 P50/P90 切換。

隨著時間堆疊區域圖表的延遲明細,顯示模型延遲和額外負荷延遲。

容量索引標籤

容量索引標籤回答「我有頭頂空間嗎?」 和「我的硬體正常運作嗎?」—顯示與預留容量相比的實際使用率。

容量運作狀態

效能索引標籤相同的 Honeycomb 視覺化,顯示執行個體、IC 複本和端點的警示狀態。

顯示 AZ 警示狀態的容量運作狀態 Honeycomb。
執行個體容量資料表

GPU、GPU 記憶體、CPU、記憶體和磁碟的每個執行個體使用率長條。

顯示 GPU、GPU 記憶體、CPU、記憶體和磁碟使用率的執行個體容量資料表。
機群使用率

時間序列顯示每個執行個體的 CPU、GPU、GPU 記憶體、記憶體和磁碟使用率,以及執行個體、IC 複本和端點檢視的切換。

機群使用率圖表顯示 CPU、GPU、GPU 記憶體、記憶體和磁碟使用率隨時間的變化。

可靠性索引標籤

可靠性索引標籤回答「彈性嗎?」 和「為什麼擴展失敗?」—涵蓋 AZ 分佈、擴展行為和佈建事件。

可用區域分佈

長條圖顯示每個可用區域的執行個體或 IC 複製計數,以驗證高可用性 (HA) 合規。

可用區域分佈長條圖顯示每個可用區域的執行個體計數。
冷啟動結構

水平堆疊列顯示佈建時間到模型下載、GPU 負載、容器啟動和平台額外負荷 (僅限 IC 端點) 的明細。

冷啟動結構,顯示模型下載、GPU 負載、容器啟動和平台額外負荷。
ICE 診斷

隨著時間的推移,容量不足錯誤 (ICE) 計數,事件資料表會顯示時間、端點、失敗的執行個體類型和失敗的 AZ。非零值表示容量限制。

ICE 診斷面板顯示一段時間內的 ICE 計數和事件資料表。