View a markdown version of this page

Enhanced Container Insights (Classic) メトリクスのリファレンス - Amazon CloudWatch

Enhanced Container Insights (Classic) メトリクスのリファレンス

Enhanced Container Insights (Classic) は、CloudWatch の ContainerInsights 名前空間にメトリクスを公開します。次の表に、すべてのメトリクスをカテゴリ別に、ディメンションと説明とともに一覧表示します。

注記

OTel Container Insights メトリクスについては、オープンソースのメトリクス名を一覧表示する「OTel Container Insights (推奨)」を参照してください。

クラスターメトリクス

次のメトリクスは、Amazon EKS クラスターの全体的な状態と容量を測定します。

メトリクス名 ディメンション 説明
cluster_failed_node_count ClusterName クラスター内の失敗したワーカーノードの数。
cluster_node_count ClusterName クラスター内のワーカーノードの総数。

ノードのメトリクス

次のメトリクスは、ノードレベルでリソースの使用状況と容量を測定します。

メトリクス名 ディメンション 説明
node_cpu_limit ClusterName, InstanceId, NodeName ノードに割り当てることができる CPU ユニットの最大数。
node_cpu_reserved_capacity ClusterName, InstanceId, NodeName ノードで予約されている CPU ユニットの割合。
node_cpu_usage_total ClusterName, InstanceId, NodeName ノードで使用されている CPU ユニットの数。
node_cpu_utilization ClusterName, InstanceId, NodeName ノードで使用されている CPU ユニットの割合。
node_filesystem_utilization ClusterName, InstanceId, NodeName ノードで使用されているファイルシステム容量の割合。
node_memory_limit ClusterName, InstanceId, NodeName ノードに割り当てることができるメモリの最大量 (バイト単位)。
node_memory_reserved_capacity ClusterName, InstanceId, NodeName ノードで予約されているメモリの割合。
node_memory_utilization ClusterName, InstanceId, NodeName ノードで使用されているメモリの割合。
node_memory_working_set ClusterName, InstanceId, NodeName ノードのワーキングセット内のメモリの量 (バイト単位)。
node_network_total_bytes ClusterName, InstanceId, NodeName ノードでネットワーク経由で送信および受信された 1 秒あたりの合計バイト数。
node_number_of_running_containers ClusterName, InstanceId, NodeName ノードで実行中のコンテナの数。
node_number_of_running_pods ClusterName, InstanceId, NodeName ノードで実行中のポッドの数。

ポッドのメトリクス

次のメトリクスは、ポッドレベルでリソースの使用状況を測定します。

メトリクス名 ディメンション 説明
pod_cpu_utilization ClusterName, Namespace, PodName ポッドが使用する CPU ユニットの割合。
pod_cpu_utilization_over_pod_limit ClusterName, Namespace, PodName ポッドの制限に対する、使用されている CPU ユニットの割合。
pod_cpu_usage_total ClusterName, Namespace, PodName ポッドが使用する CPU ユニットの数。
pod_memory_utilization ClusterName, Namespace, PodName ポッドが使用するメモリの使用率。
pod_memory_utilization_over_pod_limit ClusterName, Namespace, PodName ポッドの制限に対する、使用されているメモリの割合。
pod_memory_working_set ClusterName, Namespace, PodName ポッドのワーキングセット内のメモリの量 (バイト単位)。
pod_network_rx_bytes ClusterName, Namespace, PodName ポッドがネットワーク経由で受信している 1 秒あたりのバイト数。
pod_network_tx_bytes ClusterName, Namespace, PodName ポッドがネットワーク経由で送信している 1 秒あたりのバイト数。
pod_number_of_container_restarts ClusterName, Namespace, PodName ポッドでのコンテナ再起動の合計数。

コンテナのメトリクス

次のメトリクスは、コンテナレベルでリソースの使用状況を測定します。

メトリクス名 ディメンション 説明
container_cpu_utilization ClusterName, Namespace, PodName, ContainerName コンテナが使用する CPU ユニットの割合。
container_memory_utilization ClusterName, Namespace, PodName, ContainerName コンテナが使用するメモリの割合。

サービスと名前空間のメトリクス

次のメトリクスは、サービスと名前空間のレベルでポッド数を測定します。

メトリクス名 ディメンション 説明
service_number_of_running_pods ClusterName, Namespace, Service サービスのために実行されているポッドの数。
namespace_number_of_running_pods ClusterName, Namespace 名前空間で実行中のポッドの数。

NVIDIA GPU メトリクス

クラスターに NVIDIA GPU 搭載ノードがある場合、次のメトリクスが収集されます。これらのメトリクスは、ノード、ポッド、コンテナ全体で GPU コンピューティングとメモリの使用率をモニタリングするのに役立ちます。

メトリクス名 ディメンション 説明
node_gpu_utilization ClusterName, InstanceId, NodeName ノードで使用されている GPU コンピューティング容量の割合。
node_gpu_memory_utilization ClusterName, InstanceId, NodeName ノードで使用されている GPU メモリの割合。
node_gpu_temperature ClusterName, InstanceId, NodeName ノードでの GPU の温度 (摂氏)。
pod_gpu_utilization ClusterName, Namespace, PodName ポッドが使用する GPU コンピューティング容量の割合。
container_gpu_utilization ClusterName, Namespace, PodName, ContainerName コンテナが使用する GPU コンピューティング容量の割合。

AWS Neuron のメトリクス

クラスターに Inf1 や Inf2 などの AWS Neuron 搭載インスタンスがある場合、次のメトリクスが収集されます。これらのメトリクスは、ノードおよびポッドのレベルで NeuronCore 使用率をモニタリングするのに役立ちます。

メトリクス名 ディメンション 説明
node_neuroncore_utilization ClusterName, InstanceId, NodeName ノードで使用されている NeuronCore コンピューティング容量の割合。
pod_neuroncore_utilization ClusterName, Namespace, PodName ポッドで使用されている NeuronCore コンピューティング容量の割合。

Kubernetes API サーバーのメトリクス

次のメトリクスは、Kubernetes API サーバーから収集されます。これらのメトリクスは、コントロールプレーンの状態とパフォーマンスをモニタリングするのに役立ちます。

メトリクス名 ディメンション 説明
apiserver_storage_objects ClusterName API サーバーが etcd に保存するオブジェクトの数。
apiserver_request_total ClusterName API サーバーが受信したリクエストの合計数。
apiserver_request_duration_seconds ClusterName API サーバーリクエストのレイテンシー (秒単位)。