

# SageMaker AI Insights OpenTelemetry メトリクスリファレンス
<a name="SageMaker-AI-Insights-Metrics"></a>

このセクションでは、SageMaker AI の詳細なオブザーバビリティによって出力される OpenTelemetry メトリクスの包括的なリストを提供します。詳細なオブザーバビリティは OpenTelemetry (OTel) 上に構築されており、GPU、ノード、推論フレームワークの各レイヤーから粒度の細かい運用メトリクスを収集し、豊富なラベルを使用して CloudWatch に発行します。

**注記**  
詳細なオブザーバビリティは、OpenTelemetry (OTel) メトリクスを OTLP 経由で CloudWatch に発行します。これらは Prometheus メトリクスではありません。メトリクスは OTel メトリクスデータとして CloudWatch にネイティブに保存され、PromQL 構文を使用してクエリを実行できます。

## アカウントレベルの集計メトリクス
<a name="SageMaker-AI-Insights-Metrics-account"></a>


| メトリクス | 型 | 説明 | 
| --- | --- | --- | 
| TotalEndpoints | Aggregate | アカウント内のすべてのエンドポイントの数 | 
| TotalICs | 集計 | すべての推論コンポーネントの数 | 
| TotalGPUs | 集計 | すべての GPU の数 (DCGM\_FI\_DEV\_GPU\_UTIL から派生) | 

## エンドポイントレベルのメトリクス
<a name="SageMaker-AI-Insights-Metrics-endpoint"></a>


| メトリクス | 型 | 説明 | 
| --- | --- | --- | 
| InstanceCountPerEndpoint | Aggregate | トラフィックを処理するインスタンス数 | 
| InstancesPerAZ | 集計 | アベイラビリティーゾーンごとのインスタンス数 | 
| EmptyInstanceCount | 集計 | IC が配置されていないインスタンス数 | 
| ScalingAction | Raw | スケーリングイベント (入力/出力) | 
| ICECount | Raw | 容量不足エラー数 | 
| CPUUtilization (EP) | 集計 | エンドポイントレベルの CPU 使用率 | 
| MemoryUtilization (EP) | 集計 | エンドポイントレベルのメモリ使用率 | 
| DiskUtilization (EP) | 集計 | エンドポイントレベルのディスク使用率 | 
| E2EScalingLatency | Raw | E2E スケーリング期間 | 
| RebalancingType | Raw | 再調整イベントのタイプ | 
| RebalancingDuration | Raw | 再調整期間 (秒) | 
| RebalancingCopiesMoved | Raw | 再調整中に移動された IC コピー数 | 
| AZSkewDelta | Raw | AZ 分散の不均衡度 | 
| InstancesReleased | Raw | 再調整によって解放されたインスタンス数 | 

## 推論フレームワークのメトリクス数 (vLLM/SGLang)
<a name="SageMaker-AI-Insights-Metrics-framework"></a>


| メトリクス | 型 | 説明 | 
| --- | --- | --- | 
| InputTokensPerSecond | Aggregate | 入力トークンレート | 
| OutputTokensPerSecond | 集計 | 出力トークンレート | 
| TotalTPS | 集計 | 1 秒あたりの合計トークン数 | 
| TPSUtilization | 集計 | TPS 使用率 (%) | 
| TTFT | Raw | 最初のトークンまでの時間 (ヒストグラム) | 
| InterTokenLatency | Raw | トークン間レイテンシー (ヒストグラム) | 
| KVCacheUtilization | Raw | KV キャッシュ使用率 (%) | 
| QueueDepth | Raw | 待機リクエスト数 (キュー) | 
| BatchSize | Raw | 実行中 (処理中) のリクエスト数 | 
| TPSPerInstance | 集計 | インスタンスごとに集計された TPS | 
| ConcurrentReqsPerCopy | Raw | コピーごとの処理中のリクエスト数 | 
| FirstChunkLatencyPerIC | Raw | IC あたりの TTFT | 
| 4XXErrorRatePerIC | 集計 | IC あたりのクライアントエラー数 | 
| 5XXErrorRatePerIC | 集計 | IC あたりのサーバーエラー数 | 
| TTFTPerIC | Raw | IC でフィルタリングされた TTFT | 
| ITLPerIC | Raw | IC でフィルタリングされた ITL | 
| InputTPSPerIC | 集計 | IC あたりの入力 TPS | 
| OutputTPSPerIC | 集計 | IC あたりの出力 TPS | 
| KVCachePerIC | Raw | IC あたりの KV キャッシュ | 
| ModelErrorBreakdown | 集計 | エラーのタイプ別内訳 | 

**注記**  
`TTFT` および `InterTokenLatency` はフレームワークに依存し、vLLM および SGLang でのみサポートされています。

## GPU (DCGM) メトリクス
<a name="SageMaker-AI-Insights-Metrics-gpu"></a>

これらのメトリクスは、NVIDIA Data Center GPU Manager (DCGM) エクスポーターから収集されます。推論フレームワークに関係なく、すべての GPU エンドポイントで使用できます。


| メトリクス | 型 | 説明 | 
| --- | --- | --- | 
| DCGM\_FI\_DEV\_GPU\_UTIL | Raw | GPU 使用率 (%) | 
| DCGM\_FI\_DEV\_MEM\_COPY\_UTIL | Raw | メモリコピー使用率 (%) | 
| DCGM\_FI\_DEV\_GPU\_TEMP | Raw | GPU 温度 (°C) | 
| DCGM\_FI\_DEV\_MEMORY\_TEMP | Raw | メモリ温度 (°C) | 
| DCGM\_FI\_DEV\_FB\_FREE | Raw | フレームバッファの空きメモリ (バイト) | 
| DCGM\_FI\_DEV\_FB\_USED | Raw | 使用されたフレームバッファメモリ (バイト) | 
| DCGM\_FI\_DEV\_SM\_ACTIVE | Raw | ストリーミングマルチプロセッサの稼働率 (%) | 

## ノード (インスタンス) メトリクス
<a name="SageMaker-AI-Insights-Metrics-node"></a>

これらのメトリクスはノードエクスポーターから収集されます。CPU、メモリ、およびディスク使用率をインスタンスレベルで可視化します。


| メトリクス | 型 | 説明 | 
| --- | --- | --- | 
| node\_cpu\_seconds\_total | Raw | モードごと、コアごとの CPU 時間 (秒) | 
| node\_memory\_MemTotal\_bytes | Raw | 合計メモリ (バイト) | 
| node\_memory\_MemAvailable\_bytes | Raw | 使用可能なメモリ (バイト) | 
| node\_filesystem\_size\_bytes | Raw | ファイルシステムの合計サイズ (バイト) | 
| node\_filesystem\_avail\_bytes | Raw | ファイルシステムの使用可能なスペース (バイト) | 

## HA および IC 配置メトリクス
<a name="SageMaker-AI-Insights-Metrics-ha"></a>


| メトリクス | 型 | 説明 | 
| --- | --- | --- | 
| ICCopyCountPerAZ | Aggregate | AZ あたりの IC コピー数 | 
| ICCopiesPerAZ | 集計 | AZ あたりの IC コピー数 (代替ビュー) | 
| AZSkewScore | 集計 | AZ 不均衡度スコア | 
| AZBalanceScore | 集計 | エンドポイントレベルの均衡度 | 
| ICDensityPerAZ | 集計 | AZ あたりの IC 密度 | 
| ICCopiesPerInstance | 集計 | インスタンスあたりの IC コピー数 | 
| ICListPerInstance | 集計 | インスタンスの IC 数 | 

## ライフサイクルとプロビジョニングのメトリクス
<a name="SageMaker-AI-Insights-Metrics-lifecycle"></a>


| メトリクス | 型 | 説明 | 
| --- | --- | --- | 
| ModelDownloadTime | Raw | Amazon S3 がインスタンスをダウンロードする時間 | 
| GPULoadTime | Raw | 重みを GPU メモリへ転送する時間 | 
| ContainerStartDuration | Raw | コンテナの起動からヘルスチェックまでの時間 | 
| ColdStartDuration | Raw | E2E: 作成から最初の呼び出しまでの時間 | 

## CloudWatch Classic メトリクスとしてのみ使用できるメトリクス
<a name="SageMaker-AI-Insights-Metrics-classic"></a>

次のメトリクスは CloudWatch Classic メトリクス (名前空間およびディメンションモデル) としてのみ使用でき、OpenTelemetry メトリクスとして表示するには OTel エンリッチメントが必要になります。


| メトリクス | 注意事項 | 
| --- | --- | 
| InvocationsPerIC | OpenTelemetry からの直接送信をブロック | 
| InvocationsPerCopy | ブロック | 
| ModelLatencyPerIC | ブロック (OTel の代替として vllm:e2e\_request\_latency\_seconds を使用) | 
| OverheadLatencyPerIC | ブロック | 
| MidStreamErrorsPerIC | ブロック (双方向ストリーミングのみ) | 