

本文為英文版的機器翻譯版本，如內容有任何歧義或不一致之處，概以英文版為準。

# SageMaker AI Insights 儀表板
<a name="SageMaker-AI-Insights-Dashboard"></a>

SageMaker AI Insights 儀表板分為三個標籤：**效能**、**容量**和**可靠性**。每個索引標籤都會提供推論端點運作狀態的重點檢視。

## 儀表板配置
<a name="SageMaker-AI-Insights-Dashboard-layout"></a>

### 摘要列
<a name="SageMaker-AI-Insights-Dashboard-summary-bar"></a>

儀表板頂端的摘要列會顯示整個機群的總計。

![SageMaker AI Insights 儀表板標頭具有摘要列，顯示調用、執行個體、推論元件和平均可用區域扭曲。](http://docs.aws.amazon.com/zh_tw/AmazonCloudWatch/latest/monitoring/images/smai_New_Insights_Dashbaord.png)



| 指標 | 說明 | 
| --- | --- | 
| 調用 | 所選時間範圍內所有端點的調用總數 | 
| 執行個體 | 目前為流量提供服務的執行個體總數 | 
| 推論元件 | 所有端點的推論元件總數 | 
| 平均可用區域偏斜 | 平均可用區域分佈不平衡 (0% = 完美平衡） | 

### 篩選條件面板
<a name="SageMaker-AI-Insights-Dashboard-filters"></a>


| 篩選條件 | 說明 | 
| --- | --- | 
| Endpoint | 為機群檢視選取特定端點或所有端點  | 
| 執行個體 | 選取特定執行個體 （需要先選取端點） | 
| 推論元件 | 選取特定 IC 進行精細篩選 | 

### 向下切入
<a name="SageMaker-AI-Insights-Dashboard-drill-down"></a>

SageMaker AI Insights 支援漸進式向下切入。

1. **機群層級 **（預設） - 所有端點可見、彙總摘要指標

1. **端點層級** - 從篩選面板中選取端點，或在任何資料表中選擇端點連結

1. **IC 層級** - 從篩選面板中選取推論元件

### 使用 SageMaker AI 主控台進行交叉連結
<a name="SageMaker-AI-Insights-Dashboard-cross-linking"></a>
+ 選擇端點名稱，以在 SageMaker AI 主控台中開啟端點詳細資訊頁面。
+ 選擇**檢視日誌**以開啟篩選至該端點或 IC 的 CloudWatch Logs。
+ 從 SageMaker AI 主控台中，針對每個 IC 資料列選擇在 ** SageMaker AI Insights 或指標中檢視**。 ****

## 存取儀表板
<a name="SageMaker-AI-Insights-Dashboard-accessing"></a>

您可以從 主控台的多個位置存取 SageMaker AI Insights 儀表板。
+ **從端點清單頁面：**選擇在 ** SageMaker AI Insights 中檢視**，在未套用篩選條件的機群層級開啟儀表板。  
![端點清單頁面，顯示在 SageMaker AI Insights 中檢視按鈕。](http://docs.aws.amazon.com/zh_tw/AmazonCloudWatch/latest/monitoring/images/smai_Observability_Enabled_page.png)
+ **從端點詳細資訊頁面：**選擇在 ** SageMaker AI Insights 中檢視**，以開啟篩選至該端點的儀表板。  
![端點詳細資訊頁面顯示在 SageMaker AI Insights 中檢視按鈕。](http://docs.aws.amazon.com/zh_tw/AmazonCloudWatch/latest/monitoring/images/smai_Endpoint_detail_page.png)
+ **從推論元件詳細資訊頁面：**選擇在 ** SageMaker AI Insights 中檢視**，以開啟篩選至該端點和推論元件的儀表板。  
![顯示在 SageMaker AI Insights 中檢視按鈕的推論元件詳細資訊頁面。](http://docs.aws.amazon.com/zh_tw/AmazonCloudWatch/latest/monitoring/images/smai_IC_Detaild_page.png)
+ **直接導覽：**CloudWatch 主控台 → **基礎設施監控** → **SageMaker AI Insights**。

## 效能索引標籤
<a name="SageMaker-AI-Insights-Dashboard-performance"></a>

**效能**索引標籤回答「運作狀態良好嗎？」 和「為什麼速度變慢？」—從頂端的機群整體運作狀態流動到底部的每個 IC 診斷。

效能運作狀態  
依可用區域分組的 Honeycombs 可快速顯示執行個體、IC 複本和端點的警示狀態。  

![顯示 AZ 警示狀態的效能運作狀態 Honeycomb。](http://docs.aws.amazon.com/zh_tw/AmazonCloudWatch/latest/monitoring/images/smai_Performance_health_AZ_honey_comb.png)


執行個體效能資料表  
每個執行個體明細顯示 TTFT (P50/P99)、輸出 TPS (avg/max)、並行請求 (live/max) 和 KV 快取使用率。  

![顯示 TTFT、輸出 TPS、並行請求和 KV 快取的執行個體效能資料表。](http://docs.aws.amazon.com/zh_tw/AmazonCloudWatch/latest/monitoring/images/smai_Instance_health_performance_tab.png)


權杖串流  
時間序列圖表顯示具有 P50/P99 切換的 TTFT 和金鑰間延遲 (ITL)，依架構細分。  

![權杖串流圖表顯示隨時間變化的 TTFT 和 ITL P50/P99。](http://docs.aws.amazon.com/zh_tw/AmazonCloudWatch/latest/monitoring/images/smai_Token_streaming.png)


字符輸送量  
依架構的每秒輸入和輸出字符，具有輸入/輸出、百分位數和依執行個體檢視的切換。  

![權杖輸送量圖表顯示每秒的輸入和輸出權杖。](http://docs.aws.amazon.com/zh_tw/AmazonCloudWatch/latest/monitoring/images/smai_Token_throughput.png)


引擎和請求壓力  
隨著時間的推移，KV 快取使用率 (%)、執行中的請求和等待請求 - 推論引擎的關鍵飽和訊號。  

![引擎和請求壓力面板，顯示 KV 快取、執行中的請求和等待中的請求。](http://docs.aws.amazon.com/zh_tw/AmazonCloudWatch/latest/monitoring/images/smai_Engine_and_request_pressure.png)


流量分佈  
每個執行個體或每個 IC 複製資料表顯示每分鐘調用、4XX 速率和 5XX 速率，以識別路由不平衡。  

![流量分佈表顯示每分鐘的調用、4XX 速率和執行個體的 5XX 速率。](http://docs.aws.amazon.com/zh_tw/AmazonCloudWatch/latest/monitoring/images/smai_Traffic_distribution.png)


隨著時間的推移，錯誤混合  
折線圖顯示每個 IC 隨時間變化的 4XX、5XX 和中串流錯誤率。  

![時間線圖的錯誤混合顯示 4XX、5XX 和中串流錯誤。](http://docs.aws.amazon.com/zh_tw/AmazonCloudWatch/latest/monitoring/images/smai_Error_mix_over_time.png)


隨著時間的推移，延遲明細  
具有調用標籤 （模型延遲 \+ 額外負荷延遲） 和串流 （第一個區塊模型 \+ 第一個區塊額外負荷） 的堆疊區域圖，搭配 P50/P90 切換。  

![隨著時間堆疊區域圖表的延遲明細，顯示模型延遲和額外負荷延遲。](http://docs.aws.amazon.com/zh_tw/AmazonCloudWatch/latest/monitoring/images/smai_Latency_breakdown_over_time.png)


## 容量索引標籤
<a name="SageMaker-AI-Insights-Dashboard-capacity"></a>

**容量**索引標籤回答「我有頭頂空間嗎？」 和「我的硬體正常運作嗎？」—顯示與預留容量相比的實際使用率。

容量運作狀態  
與**效能**索引標籤相同的 Honeycomb 視覺化，顯示執行個體、IC 複本和端點的警示狀態。  

![顯示 AZ 警示狀態的容量運作狀態 Honeycomb。](http://docs.aws.amazon.com/zh_tw/AmazonCloudWatch/latest/monitoring/images/smai_Capacity_health_honey_comb.png)


執行個體容量資料表  
GPU、GPU 記憶體、CPU、記憶體和磁碟的每個執行個體使用率長條。  

![顯示 GPU、GPU 記憶體、CPU、記憶體和磁碟使用率的執行個體容量資料表。](http://docs.aws.amazon.com/zh_tw/AmazonCloudWatch/latest/monitoring/images/smai_Instance_health_capacity_tab.png)


機群使用率  
時間序列顯示每個執行個體的 CPU、GPU、GPU 記憶體、記憶體和磁碟使用率，以及執行個體、IC 複本和端點檢視的切換。  

![機群使用率圖表顯示 CPU、GPU、GPU 記憶體、記憶體和磁碟使用率隨時間的變化。](http://docs.aws.amazon.com/zh_tw/AmazonCloudWatch/latest/monitoring/images/smai_Fleet_Util.png)


## 可靠性索引標籤
<a name="SageMaker-AI-Insights-Dashboard-reliability"></a>

**可靠性**索引標籤回答「彈性嗎？」 和「為什麼擴展失敗？」—涵蓋 AZ 分佈、擴展行為和佈建事件。

可用區域分佈  
長條圖顯示每個可用區域的執行個體或 IC 複製計數，以驗證高可用性 (HA) 合規。  

![可用區域分佈長條圖顯示每個可用區域的執行個體計數。](http://docs.aws.amazon.com/zh_tw/AmazonCloudWatch/latest/monitoring/images/smai_AZ_distribution.png)


冷啟動結構  
水平堆疊列顯示佈建時間到模型下載、GPU 負載、容器啟動和平台額外負荷 （僅限 IC 端點） 的明細。  

![冷啟動結構，顯示模型下載、GPU 負載、容器啟動和平台額外負荷。](http://docs.aws.amazon.com/zh_tw/AmazonCloudWatch/latest/monitoring/images/smai_Cold_start_anatomy.png)


ICE 診斷  
隨著時間的推移，容量不足錯誤 (ICE) 計數，事件資料表會顯示時間、端點、失敗的執行個體類型和失敗的 AZ。非零值表示容量限制。  

![ICE 診斷面板顯示一段時間內的 ICE 計數和事件資料表。](http://docs.aws.amazon.com/zh_tw/AmazonCloudWatch/latest/monitoring/images/smai_ICE_events.png)
