Enhanced Container Insights(Classic) 지표 참조
Enhanced Container Insights(Classic)는 CloudWatch의 ContainerInsights 네임스페이스에 지표를 게시합니다. 다음 표에는 차원 및 설명과 함께 범주별 모든 지표가 나열되어 있습니다.
참고
OTel Container Insights 지표는 오픈 소스 지표 이름이 나열된 OTel Container Insights(권장) 섹션을 참조하세요.
클러스터 지표
다음 지표는 Amazon EKS 클러스터의 전반적인 상태와 용량을 측정합니다.
| 지표 이름 | 측정 기준 | 설명 |
|---|---|---|
cluster_failed_node_count |
ClusterName |
클러스터의 실패한 작업자 노드의 숫자입니다. |
cluster_node_count |
ClusterName |
클러스터의 작업자 노드의 총 숫자입니다. |
노드 지표
다음 지표는 노드 수준에서 리소스 사용량과 용량을 측정합니다.
| 지표 이름 | 측정 기준 | 설명 |
|---|---|---|
node_cpu_limit |
ClusterName, InstanceId,
NodeName |
노드에 할당할 수 있는 최대 CPU 단위 수. |
node_cpu_reserved_capacity |
ClusterName, InstanceId,
NodeName |
노드에 예약된 CPU 단위의 백분율. |
node_cpu_usage_total |
ClusterName, InstanceId,
NodeName |
노드에서 사용되는 CPU 단위의 수. |
node_cpu_utilization |
ClusterName, InstanceId,
NodeName |
노드에서 사용되는 CPU 단위의 백분율. |
node_filesystem_utilization |
ClusterName, InstanceId,
NodeName |
노드에 사용되는 파일 시스템 용량의 백분율. |
node_memory_limit |
ClusterName, InstanceId,
NodeName |
노드에 할당할 수 있는 최대 메모리의 양(바이트). |
node_memory_reserved_capacity |
ClusterName, InstanceId,
NodeName |
노드에 예약된 메모리의 백분율. |
node_memory_utilization |
ClusterName, InstanceId,
NodeName |
노드에 사용된 메모리의 백분율. |
node_memory_working_set |
ClusterName, InstanceId,
NodeName |
노드의 작업 세트에 있는 메모리의 양(바이트). |
node_network_total_bytes |
ClusterName, InstanceId,
NodeName |
노드에서 네트워크를 통해 전송되고 수신된 초당 총 바이트 수. |
node_number_of_running_containers |
ClusterName, InstanceId,
NodeName |
노드에서 실행 중인 컨테이너 수. |
node_number_of_running_pods |
ClusterName, InstanceId,
NodeName |
노드에서 실행 중인 포드 수. |
포드 지표
다음 지표는 포드 수준에서 리소스 사용량을 측정합니다.
| 지표 이름 | 측정 기준 | 설명 |
|---|---|---|
pod_cpu_utilization |
ClusterName, Namespace,
PodName |
포드에서 사용 중인 CPU 단위의 백분율. |
pod_cpu_utilization_over_pod_limit |
ClusterName, Namespace,
PodName |
포드 제한을 기준으로 사용되는 CPU 단위의 백분율. |
pod_cpu_usage_total |
ClusterName, Namespace,
PodName |
포드에서 사용되는 CPU 단위 수. |
pod_memory_utilization |
ClusterName, Namespace,
PodName |
포드에서 사용되는 메모리의 백분율. |
pod_memory_utilization_over_pod_limit |
ClusterName, Namespace,
PodName |
포드 제한을 기준으로 사용되는 메모리의 백분율. |
pod_memory_working_set |
ClusterName, Namespace,
PodName |
포드의 작업 세트에 있는 메모리의 양(바이트). |
pod_network_rx_bytes |
ClusterName, Namespace,
PodName |
포드에서 네트워크를 통해 수신된 초당 바이트 수. |
pod_network_tx_bytes |
ClusterName, Namespace,
PodName |
포드에서 네트워크를 통해 전송된 초당 바이트 수. |
pod_number_of_container_restarts |
ClusterName, Namespace,
PodName |
포드의 컨테이너 재시작 총 횟수. |
컨테이너 지표
다음 지표는 컨테이너 수준에서 리소스 사용량을 측정합니다.
| 지표 이름 | 측정 기준 | 설명 |
|---|---|---|
container_cpu_utilization |
ClusterName, Namespace, PodName,
ContainerName |
컨테이너에서 사용되는 CPU 단위의 백분율. |
container_memory_utilization |
ClusterName, Namespace, PodName,
ContainerName |
컨테이너에서 사용되는 메모리의 비율. |
서비스 및 네임스페이스 지표
다음 지표는 서비스 및 네임스페이스 수준에서 포드 수를 측정합니다.
| 지표 이름 | 측정 기준 | 설명 |
|---|---|---|
service_number_of_running_pods |
ClusterName, Namespace,
Service |
서비스에서 실행 중인 포드 수. |
namespace_number_of_running_pods |
ClusterName, Namespace |
네임스페이스에서 실행 중인 포드 수. |
NVIDIA GPU 지표
클러스터에 NVIDIA GPU 탑재 노드가 있는 경우 다음 지표가 수집됩니다. 이러한 지표는 노드, 포드 및 컨테이너 전반의 GPU 컴퓨팅 및 메모리 사용률을 모니터링하는 데 도움이 됩니다.
| 지표 이름 | 측정 기준 | 설명 |
|---|---|---|
node_gpu_utilization |
ClusterName, InstanceId,
NodeName |
노드에서 사용되는 GPU 컴퓨팅 용량의 백분율. |
node_gpu_memory_utilization |
ClusterName, InstanceId,
NodeName |
노드에서 사용되는 GPU 메모리의 백분율. |
node_gpu_temperature |
ClusterName, InstanceId,
NodeName |
노드의 GPU 온도(섭씨). |
pod_gpu_utilization |
ClusterName, Namespace,
PodName |
포드에서 사용되는 GPU 컴퓨팅 용량의 백분율. |
container_gpu_utilization |
ClusterName, Namespace, PodName,
ContainerName |
컨테이너에서 사용되는 GPU 컴퓨팅 용량의 백분율. |
AWS Neuron 지표
클러스터에 Inf1 또는 Inf2와 같은 AWS Neuron 탑재 인스턴스가 있는 경우 다음 지표가 수집됩니다. 이러한 지표는 노드 및 포드 수준에서 NeuronCore 사용률을 모니터링하는 데 도움이 됩니다.
| 지표 이름 | 측정 기준 | 설명 |
|---|---|---|
node_neuroncore_utilization |
ClusterName, InstanceId,
NodeName |
노드에 사용되는 NeuronCore 컴퓨팅 용량의 백분율. |
pod_neuroncore_utilization |
ClusterName, Namespace,
PodName |
포드에서 사용되는 NeuronCore 컴퓨팅 용량의 백분율. |
Kubernetes API 서버 지표
다음 지표는 Kubernetes API 서버에서 수집됩니다. 이러한 지표는 컨트롤 플레인의 상태와 성능을 모니터링하는 데 도움이 됩니다.
| 지표 이름 | 측정 기준 | 설명 |
|---|---|---|
apiserver_storage_objects |
ClusterName |
API 서버에 의해 etcd에 저장된 객체 수. |
apiserver_request_total |
ClusterName |
API 서버에서 수신된 총 요청 수. |
apiserver_request_duration_seconds |
ClusterName |
초 단위의 API 서버 요청 지연 시간. |