SageMaker AI Insights OpenTelemetry メトリクスリファレンス
このセクションでは、SageMaker AI の詳細なオブザーバビリティによって出力される OpenTelemetry メトリクスの包括的なリストを提供します。詳細なオブザーバビリティは OpenTelemetry (OTel) 上に構築されており、GPU、ノード、推論フレームワークの各レイヤーから粒度の細かい運用メトリクスを収集し、豊富なラベルを使用して CloudWatch に発行します。
詳細なオブザーバビリティは、OpenTelemetry (OTel) メトリクスを OTLP 経由で CloudWatch に発行します。これらは Prometheus メトリクスではありません。メトリクスは OTel メトリクスデータとして CloudWatch にネイティブに保存され、PromQL 構文を使用してクエリを実行できます。
アカウントレベルの集計メトリクス
| メトリクス | 型 | 説明 |
TotalEndpoints | Aggregate | アカウント内のすべてのエンドポイントの数 |
TotalICs | 集計 | すべての推論コンポーネントの数 |
TotalGPUs | 集計 | すべての GPU の数 (DCGM_FI_DEV_GPU_UTIL から派生) |
エンドポイントレベルのメトリクス
| メトリクス | 型 | 説明 |
InstanceCountPerEndpoint | Aggregate | トラフィックを処理するインスタンス数 |
InstancesPerAZ | 集計 | アベイラビリティーゾーンごとのインスタンス数 |
EmptyInstanceCount | 集計 | IC が配置されていないインスタンス数 |
ScalingAction | Raw | スケーリングイベント (入力/出力) |
ICECount | Raw | 容量不足エラー数 |
CPUUtilization (EP) | 集計 | エンドポイントレベルの CPU 使用率 |
MemoryUtilization (EP) | 集計 | エンドポイントレベルのメモリ使用率 |
DiskUtilization (EP) | 集計 | エンドポイントレベルのディスク使用率 |
E2EScalingLatency | Raw | E2E スケーリング期間 |
RebalancingType | Raw | 再調整イベントのタイプ |
RebalancingDuration | Raw | 再調整期間 (秒) |
RebalancingCopiesMoved | Raw | 再調整中に移動された IC コピー数 |
AZSkewDelta | Raw | AZ 分散の不均衡度 |
InstancesReleased | Raw | 再調整によって解放されたインスタンス数 |
推論フレームワークのメトリクス数 (vLLM/SGLang)
| メトリクス | 型 | 説明 |
InputTokensPerSecond | Aggregate | 入力トークンレート |
OutputTokensPerSecond | 集計 | 出力トークンレート |
TotalTPS | 集計 | 1 秒あたりの合計トークン数 |
TPSUtilization | 集計 | TPS 使用率 (%) |
TTFT | Raw | 最初のトークンまでの時間 (ヒストグラム) |
InterTokenLatency | Raw | トークン間レイテンシー (ヒストグラム) |
KVCacheUtilization | Raw | KV キャッシュ使用率 (%) |
QueueDepth | Raw | 待機リクエスト数 (キュー) |
BatchSize | Raw | 実行中 (処理中) のリクエスト数 |
TPSPerInstance | 集計 | インスタンスごとに集計された TPS |
ConcurrentReqsPerCopy | Raw | コピーごとの処理中のリクエスト数 |
FirstChunkLatencyPerIC | Raw | IC あたりの TTFT |
4XXErrorRatePerIC | 集計 | IC あたりのクライアントエラー数 |
5XXErrorRatePerIC | 集計 | IC あたりのサーバーエラー数 |
TTFTPerIC | Raw | IC でフィルタリングされた TTFT |
ITLPerIC | Raw | IC でフィルタリングされた ITL |
InputTPSPerIC | 集計 | IC あたりの入力 TPS |
OutputTPSPerIC | 集計 | IC あたりの出力 TPS |
KVCachePerIC | Raw | IC あたりの KV キャッシュ |
ModelErrorBreakdown | 集計 | エラーのタイプ別内訳 |
TTFT および InterTokenLatency はフレームワークに依存し、vLLM および SGLang でのみサポートされています。
GPU (DCGM) メトリクス
これらのメトリクスは、NVIDIA Data Center GPU Manager (DCGM) エクスポーターから収集されます。推論フレームワークに関係なく、すべての GPU エンドポイントで使用できます。
| メトリクス | 型 | 説明 |
DCGM_FI_DEV_GPU_UTIL | Raw | GPU 使用率 (%) |
DCGM_FI_DEV_MEM_COPY_UTIL | Raw | メモリコピー使用率 (%) |
DCGM_FI_DEV_GPU_TEMP | Raw | GPU 温度 (°C) |
DCGM_FI_DEV_MEMORY_TEMP | Raw | メモリ温度 (°C) |
DCGM_FI_DEV_FB_FREE | Raw | フレームバッファの空きメモリ (バイト) |
DCGM_FI_DEV_FB_USED | Raw | 使用されたフレームバッファメモリ (バイト) |
DCGM_FI_DEV_SM_ACTIVE | Raw | ストリーミングマルチプロセッサの稼働率 (%) |
ノード (インスタンス) メトリクス
これらのメトリクスはノードエクスポーターから収集されます。CPU、メモリ、およびディスク使用率をインスタンスレベルで可視化します。
| メトリクス | 型 | 説明 |
node_cpu_seconds_total | Raw | モードごと、コアごとの CPU 時間 (秒) |
node_memory_MemTotal_bytes | Raw | 合計メモリ (バイト) |
node_memory_MemAvailable_bytes | Raw | 使用可能なメモリ (バイト) |
node_filesystem_size_bytes | Raw | ファイルシステムの合計サイズ (バイト) |
node_filesystem_avail_bytes | Raw | ファイルシステムの使用可能なスペース (バイト) |
HA および IC 配置メトリクス
| メトリクス | 型 | 説明 |
ICCopyCountPerAZ | Aggregate | AZ あたりの IC コピー数 |
ICCopiesPerAZ | 集計 | AZ あたりの IC コピー数 (代替ビュー) |
AZSkewScore | 集計 | AZ 不均衡度スコア |
AZBalanceScore | 集計 | エンドポイントレベルの均衡度 |
ICDensityPerAZ | 集計 | AZ あたりの IC 密度 |
ICCopiesPerInstance | 集計 | インスタンスあたりの IC コピー数 |
ICListPerInstance | 集計 | インスタンスの IC 数 |
ライフサイクルとプロビジョニングのメトリクス
| メトリクス | 型 | 説明 |
ModelDownloadTime | Raw | Amazon S3 がインスタンスをダウンロードする時間 |
GPULoadTime | Raw | 重みを GPU メモリへ転送する時間 |
ContainerStartDuration | Raw | コンテナの起動からヘルスチェックまでの時間 |
ColdStartDuration | Raw | E2E: 作成から最初の呼び出しまでの時間 |
CloudWatch Classic メトリクスとしてのみ使用できるメトリクス
次のメトリクスは CloudWatch Classic メトリクス (名前空間およびディメンションモデル) としてのみ使用でき、OpenTelemetry メトリクスとして表示するには OTel エンリッチメントが必要になります。
| メトリクス | 注意事項 |
InvocationsPerIC | OpenTelemetry からの直接送信をブロック |
InvocationsPerCopy | ブロック |
ModelLatencyPerIC | ブロック (OTel の代替として vllm:e2e_request_latency_seconds を使用) |
OverheadLatencyPerIC | ブロック |
MidStreamErrorsPerIC | ブロック (双方向ストリーミングのみ) |