View a markdown version of this page

Referência métrica do Enhanced Container Insights (Classic) - Amazon CloudWatch

Referência métrica do Enhanced Container Insights (Classic)

O Enhanced Container Insights (Classic) publica métricas no namespace ContainerInsights no CloudWatch. As tabelas a seguir listam todas as métricas por categoria, junto com suas dimensões e descrições.

nota

Para as métricas do OTel Container Insights, consulte OTel Container Insights (recomendado), que lista nomes de métricas de código aberto.

Métricas de cluster

As métricas a seguir medem a integridade geral e a capacidade do seu cluster do Amazon EKS.

Nome da métrica Dimensões Descrição
cluster_failed_node_count ClusterName O número de nós do operador com falha no cluster.
cluster_node_count ClusterName O número total de nós do operador no cluster.

Métricas de nó

As métricas a seguir medem o uso e a capacidade dos recursos no nível do nó.

Nome da métrica Dimensões Descrição
node_cpu_limit ClusterName, InstanceId, NodeName O número máximo de unidades de CPU que podem ser atribuídas ao nó.
node_cpu_reserved_capacity ClusterName, InstanceId, NodeName A porcentagem de unidades de CPU reservadas no nó.
node_cpu_usage_total ClusterName, InstanceId, NodeName O número de unidades de CPU usadas no nó.
node_cpu_utilization ClusterName, InstanceId, NodeName A porcentagem de unidades de CPU usadas no nó.
node_filesystem_utilization ClusterName, InstanceId, NodeName A porcentagem da capacidade do sistema de arquivos usada no nó.
node_memory_limit ClusterName, InstanceId, NodeName A quantidade máxima de memória, em bytes, que pode ser atribuída ao nó.
node_memory_reserved_capacity ClusterName, InstanceId, NodeName A porcentagem de memória reservada no nó.
node_memory_utilization ClusterName, InstanceId, NodeName A porcentagem da memória usada no nó.
node_memory_working_set ClusterName, InstanceId, NodeName A quantidade de memória, em bytes, no conjunto de trabalho do nó.
node_network_total_bytes ClusterName, InstanceId, NodeName O número total de bytes transmitidos e recebidos por segundo pela rede no nó.
node_number_of_running_containers ClusterName, InstanceId, NodeName O número de contêineres em execução no nó.
node_number_of_running_pods ClusterName, InstanceId, NodeName O número de pods em execução no nó.

Métricas de pod

As métricas a seguir medem o uso de recursos no nível do pod.

Nome da métrica Dimensões Descrição
pod_cpu_utilization ClusterName, Namespace, PodName A porcentagem de unidades de CPU usadas pelo pod.
pod_cpu_utilization_over_pod_limit ClusterName, Namespace, PodName O percentual das unidades de CPU usadas em relação ao limite de pods.
pod_cpu_usage_total ClusterName, Namespace, PodName O número de unidades de CPU usadas pelo pod.
pod_memory_utilization ClusterName, Namespace, PodName A porcentagem da memória usada pelo pod.
pod_memory_utilization_over_pod_limit ClusterName, Namespace, PodName O percentual de memória usada com relação ao limite de pods.
pod_memory_working_set ClusterName, Namespace, PodName A quantidade de memória, em bytes, no conjunto de trabalho do pod.
pod_network_rx_bytes ClusterName, Namespace, PodName O número de bytes recebidos por segundo na rede pelo pod.
pod_network_tx_bytes ClusterName, Namespace, PodName O número de bytes transmitidos por segundo na rede pelo pod.
pod_number_of_container_restarts ClusterName, Namespace, PodName O número total de reinicializações de contêineres no pod.

Métricas de contêiner

As métricas a seguir medem o uso de recursos no nível do contêiner.

Nome da métrica Dimensões Descrição
container_cpu_utilization ClusterName, Namespace, PodName, ContainerName A porcentagem de unidades de CPU usadas pelo contêiner.
container_memory_utilization ClusterName, Namespace, PodName, ContainerName A porcentagem de unidades de memória usada pelo contêiner.

Métricas de serviço e namespace

As métricas a seguir medem a contagem de pods no nível do serviço e do namespace.

Nome da métrica Dimensões Descrição
service_number_of_running_pods ClusterName, Namespace, Service O número de pods em execução para o serviço.
namespace_number_of_running_pods ClusterName, Namespace O número de pods em execução no namespace.

Métricas da GPU NVIDIA

As métricas a seguir são coletadas quando seu cluster tem nós equipados com GPU NVIDIA. Essas métricas ajudam você a monitorar a utilização da computação e da memória da GPU em nós, pods e contêineres.

Nome da métrica Dimensões Descrição
node_gpu_utilization ClusterName, InstanceId, NodeName A porcentagem de capacidade de computação de GPU usada no nó.
node_gpu_memory_utilization ClusterName, InstanceId, NodeName A porcentagem de memória de GPU usada no nó.
node_gpu_temperature ClusterName, InstanceId, NodeName A temperatura da GPU em graus Celsius no nó.
pod_gpu_utilization ClusterName, Namespace, PodName A porcentagem de capacidade de computação de GPU usada pelo pod.
container_gpu_utilization ClusterName, Namespace, PodName, ContainerName A porcentagem de capacidade de computação de GPU usada pelo contêiner.

Métricas do AWS Neuron

As métricas a seguir são coletadas quando seu cluster tem instâncias da AWS equipadas com Neuron, como Inf1 ou Inf2. Essas métricas ajudam você a monitorar a utilização do NeuronCore no nível do nó e do pod.

Nome da métrica Dimensões Descrição
node_neuroncore_utilization ClusterName, InstanceId, NodeName A porcentagem da capacidade computacional do NeuronCore usada no nó.
pod_neuroncore_utilization ClusterName, Namespace, PodName A porcentagem da capacidade computacional do NeuronCore usada pelo pod.

Métricas do servidor de API do Kubernetes

As métricas a seguir são coletadas do servidor de API do Kubernetes. Essas métricas ajudam você a monitorar a integridade e o desempenho do ambiente de gerenciamento.

Nome da métrica Dimensões Descrição
apiserver_storage_objects ClusterName O número de objetos armazenados no etcd pelo servidor de API.
apiserver_request_total ClusterName O número total de solicitações recebidas pelo servidor de API.
apiserver_request_duration_seconds ClusterName A latência das solicitações do servidor de API, em segundos.