View a markdown version of this page

Referencia de métricas de Información de contenedores mejorada (versión clásica) - Amazon CloudWatch

Referencia de métricas de Información de contenedores mejorada (versión clásica)

Información de contenedores mejorada (versión clásica) publica las métricas en el espacio de nombres ContainerInsights de CloudWatch. En las siguientes tablas se enumeran todas las métricas por categoría, junto con sus dimensiones y descripciones.

nota

Para ver las métricas de Información de contenedores de OTel, consulte Información de contenedores de OTel (recomendado), donde se enumeran los nombres de las métricas de código abierto.

Métricas de clúster

Las siguientes métricas miden el estado y la capacidad generales del clúster de Amazon EKS.

Nombre de métrica Dimensiones Descripción
cluster_failed_node_count ClusterName El número de nodos de trabajo con errores en el clúster.
cluster_node_count ClusterName El número total de nodos de trabajo en el clúster.

Métricas de nodos

Las siguientes métricas miden el uso y la capacidad de los recursos a nivel de nodo.

Nombre de métrica Dimensiones Descripción
node_cpu_limit ClusterName, InstanceId, NodeName El número máximo de unidades de CPU que se pueden asignar al nodo.
node_cpu_reserved_capacity ClusterName, InstanceId, NodeName El porcentaje de unidades de CPU reservadas en el nodo.
node_cpu_usage_total ClusterName, InstanceId, NodeName El número de unidades de CPU usadas en el nodo.
node_cpu_utilization ClusterName, InstanceId, NodeName El porcentaje de unidades de CPU usadas en el nodo.
node_filesystem_utilization ClusterName, InstanceId, NodeName El porcentaje de capacidad del sistema de archivos utilizado en el nodo.
node_memory_limit ClusterName, InstanceId, NodeName La cantidad máxima de memoria, en bytes, que se puede asignar al nodo.
node_memory_reserved_capacity ClusterName, InstanceId, NodeName El porcentaje de memoria reservada en el nodo.
node_memory_utilization ClusterName, InstanceId, NodeName El porcentaje de memoria utilizada en el nodo.
node_memory_working_set ClusterName, InstanceId, NodeName La cantidad de memoria, en bytes, en el conjunto de trabajo del nodo.
node_network_total_bytes ClusterName, InstanceId, NodeName El número total de bytes por segundo transmitidos y recibidos a través de la red en el nodo.
node_number_of_running_containers ClusterName, InstanceId, NodeName El número de contenedores en ejecución en el nodo.
node_number_of_running_pods ClusterName, InstanceId, NodeName El número de pods en ejecución en el nodo.

Métricas del pod

Las siguientes métricas miden el uso de los recursos a nivel de pod.

Nombre de métrica Dimensiones Descripción
pod_cpu_utilization ClusterName, Namespace, PodName El porcentaje de unidades de CPU que utiliza el pod.
pod_cpu_utilization_over_pod_limit ClusterName, Namespace, PodName El porcentaje de unidades de CPU utilizadas en relación con el límite de pods.
pod_cpu_usage_total ClusterName, Namespace, PodName El número de unidades de CPU que utiliza el pod.
pod_memory_utilization ClusterName, Namespace, PodName El porcentaje de memoria que utiliza el pod.
pod_memory_utilization_over_pod_limit ClusterName, Namespace, PodName El porcentaje de memoria utilizada en relación con el límite de pods.
pod_memory_working_set ClusterName, Namespace, PodName La cantidad de memoria, en bytes, en el conjunto de trabajo del pod.
pod_network_rx_bytes ClusterName, Namespace, PodName El número de bytes recibidos por segundo a través de la red por el pod.
pod_network_tx_bytes ClusterName, Namespace, PodName El número de bytes transmitidos por segundo a través de la red por el pod.
pod_number_of_container_restarts ClusterName, Namespace, PodName El número total de reinicios del contenedor en el pod.

Métricas de contenedores

Las siguientes métricas miden el uso de los recursos a nivel de contenedor.

Nombre de métrica Dimensiones Descripción
container_cpu_utilization ClusterName, Namespace, PodName, ContainerName El porcentaje de unidades de CPU que utiliza el contenedor.
container_memory_utilization ClusterName, Namespace, PodName, ContainerName El porcentaje de memoria que utiliza el contenedor.

Métricas de espacio de nombres y servicios

Las siguientes métricas miden los recuentos de pods a nivel de servicio y espacio de nombres.

Nombre de métrica Dimensiones Descripción
service_number_of_running_pods ClusterName, Namespace, Service El número de pods en ejecución para el servicio.
namespace_number_of_running_pods ClusterName, Namespace La cantidad de pods en ejecución en el espacio de nombres.

Métricas de GPU de NVIDIA

Las siguientes métricas se recopilan cuando el clúster tiene nodos equipados con GPU NVIDIA. Estas métricas le ayudan a supervisar el uso de la memoria y la computación de la GPU en todos los nodos, pods y contenedores.

Nombre de métrica Dimensiones Descripción
node_gpu_utilization ClusterName, InstanceId, NodeName El porcentaje de capacidad de computación de la GPU utilizado en el nodo.
node_gpu_memory_utilization ClusterName, InstanceId, NodeName El porcentaje de memoria de GPU utilizada en el nodo.
node_gpu_temperature ClusterName, InstanceId, NodeName La temperatura de la GPU en grados Celsius en el nodo.
pod_gpu_utilization ClusterName, Namespace, PodName El porcentaje de capacidad de computación de la GPU utilizado por el pod.
container_gpu_utilization ClusterName, Namespace, PodName, ContainerName El porcentaje de capacidad de computación de la GPU utilizado por el contenedor.

Métricas de AWS Neuron

Las siguientes métricas se recopilan cuando el clúster tiene instancias equipadas con AWS Neuron, como Inf1 o Inf2. Estas métricas le ayudan a supervisar la utilización de NeuronCore a nivel de nodo y pod.

Nombre de métrica Dimensiones Descripción
node_neuroncore_utilization ClusterName, InstanceId, NodeName El porcentaje de capacidad de computación de NeuronCore utilizado en el nodo.
pod_neuroncore_utilization ClusterName, Namespace, PodName El porcentaje de capacidad de computación de NeuronCore utilizado por el pod.

Métricas del servidor de la API de Kubernetes

Las siguientes métricas se recopilan del servidor de la API de Kubernetes. Estas métricas ayudan a supervisar el estado y el rendimiento del plano de control.

Nombre de métrica Dimensiones Descripción
apiserver_storage_objects ClusterName La cantidad de objetos almacenados en etcd por el servidor de la API.
apiserver_request_total ClusterName El número total de solicitudes recibidas por el servidor de la API.
apiserver_request_duration_seconds ClusterName La latencia de las solicitudes del servidor de la API, en segundos.