Referência métrica do Enhanced Container Insights (Classic)
O Enhanced Container Insights (Classic) publica métricas no namespace ContainerInsights no CloudWatch. As tabelas a seguir listam todas as métricas por categoria, junto com suas dimensões e descrições.
nota
Para as métricas do OTel Container Insights, consulte OTel Container Insights (recomendado), que lista nomes de métricas de código aberto.
Métricas de cluster
As métricas a seguir medem a integridade geral e a capacidade do seu cluster do Amazon EKS.
| Nome da métrica | Dimensões | Descrição |
|---|---|---|
cluster_failed_node_count |
ClusterName |
O número de nós do operador com falha no cluster. |
cluster_node_count |
ClusterName |
O número total de nós do operador no cluster. |
Métricas de nó
As métricas a seguir medem o uso e a capacidade dos recursos no nível do nó.
| Nome da métrica | Dimensões | Descrição |
|---|---|---|
node_cpu_limit |
ClusterName, InstanceId,
NodeName |
O número máximo de unidades de CPU que podem ser atribuídas ao nó. |
node_cpu_reserved_capacity |
ClusterName, InstanceId,
NodeName |
A porcentagem de unidades de CPU reservadas no nó. |
node_cpu_usage_total |
ClusterName, InstanceId,
NodeName |
O número de unidades de CPU usadas no nó. |
node_cpu_utilization |
ClusterName, InstanceId,
NodeName |
A porcentagem de unidades de CPU usadas no nó. |
node_filesystem_utilization |
ClusterName, InstanceId,
NodeName |
A porcentagem da capacidade do sistema de arquivos usada no nó. |
node_memory_limit |
ClusterName, InstanceId,
NodeName |
A quantidade máxima de memória, em bytes, que pode ser atribuída ao nó. |
node_memory_reserved_capacity |
ClusterName, InstanceId,
NodeName |
A porcentagem de memória reservada no nó. |
node_memory_utilization |
ClusterName, InstanceId,
NodeName |
A porcentagem da memória usada no nó. |
node_memory_working_set |
ClusterName, InstanceId,
NodeName |
A quantidade de memória, em bytes, no conjunto de trabalho do nó. |
node_network_total_bytes |
ClusterName, InstanceId,
NodeName |
O número total de bytes transmitidos e recebidos por segundo pela rede no nó. |
node_number_of_running_containers |
ClusterName, InstanceId,
NodeName |
O número de contêineres em execução no nó. |
node_number_of_running_pods |
ClusterName, InstanceId,
NodeName |
O número de pods em execução no nó. |
Métricas de pod
As métricas a seguir medem o uso de recursos no nível do pod.
| Nome da métrica | Dimensões | Descrição |
|---|---|---|
pod_cpu_utilization |
ClusterName, Namespace,
PodName |
A porcentagem de unidades de CPU usadas pelo pod. |
pod_cpu_utilization_over_pod_limit |
ClusterName, Namespace,
PodName |
O percentual das unidades de CPU usadas em relação ao limite de pods. |
pod_cpu_usage_total |
ClusterName, Namespace,
PodName |
O número de unidades de CPU usadas pelo pod. |
pod_memory_utilization |
ClusterName, Namespace,
PodName |
A porcentagem da memória usada pelo pod. |
pod_memory_utilization_over_pod_limit |
ClusterName, Namespace,
PodName |
O percentual de memória usada com relação ao limite de pods. |
pod_memory_working_set |
ClusterName, Namespace,
PodName |
A quantidade de memória, em bytes, no conjunto de trabalho do pod. |
pod_network_rx_bytes |
ClusterName, Namespace,
PodName |
O número de bytes recebidos por segundo na rede pelo pod. |
pod_network_tx_bytes |
ClusterName, Namespace,
PodName |
O número de bytes transmitidos por segundo na rede pelo pod. |
pod_number_of_container_restarts |
ClusterName, Namespace,
PodName |
O número total de reinicializações de contêineres no pod. |
Métricas de contêiner
As métricas a seguir medem o uso de recursos no nível do contêiner.
| Nome da métrica | Dimensões | Descrição |
|---|---|---|
container_cpu_utilization |
ClusterName, Namespace, PodName,
ContainerName |
A porcentagem de unidades de CPU usadas pelo contêiner. |
container_memory_utilization |
ClusterName, Namespace, PodName,
ContainerName |
A porcentagem de unidades de memória usada pelo contêiner. |
Métricas de serviço e namespace
As métricas a seguir medem a contagem de pods no nível do serviço e do namespace.
| Nome da métrica | Dimensões | Descrição |
|---|---|---|
service_number_of_running_pods |
ClusterName, Namespace,
Service |
O número de pods em execução para o serviço. |
namespace_number_of_running_pods |
ClusterName, Namespace |
O número de pods em execução no namespace. |
Métricas da GPU NVIDIA
As métricas a seguir são coletadas quando seu cluster tem nós equipados com GPU NVIDIA. Essas métricas ajudam você a monitorar a utilização da computação e da memória da GPU em nós, pods e contêineres.
| Nome da métrica | Dimensões | Descrição |
|---|---|---|
node_gpu_utilization |
ClusterName, InstanceId,
NodeName |
A porcentagem de capacidade de computação de GPU usada no nó. |
node_gpu_memory_utilization |
ClusterName, InstanceId,
NodeName |
A porcentagem de memória de GPU usada no nó. |
node_gpu_temperature |
ClusterName, InstanceId,
NodeName |
A temperatura da GPU em graus Celsius no nó. |
pod_gpu_utilization |
ClusterName, Namespace,
PodName |
A porcentagem de capacidade de computação de GPU usada pelo pod. |
container_gpu_utilization |
ClusterName, Namespace, PodName,
ContainerName |
A porcentagem de capacidade de computação de GPU usada pelo contêiner. |
Métricas do AWS Neuron
As métricas a seguir são coletadas quando seu cluster tem instâncias da AWS equipadas com Neuron, como Inf1 ou Inf2. Essas métricas ajudam você a monitorar a utilização do NeuronCore no nível do nó e do pod.
| Nome da métrica | Dimensões | Descrição |
|---|---|---|
node_neuroncore_utilization |
ClusterName, InstanceId,
NodeName |
A porcentagem da capacidade computacional do NeuronCore usada no nó. |
pod_neuroncore_utilization |
ClusterName, Namespace,
PodName |
A porcentagem da capacidade computacional do NeuronCore usada pelo pod. |
Métricas do servidor de API do Kubernetes
As métricas a seguir são coletadas do servidor de API do Kubernetes. Essas métricas ajudam você a monitorar a integridade e o desempenho do ambiente de gerenciamento.
| Nome da métrica | Dimensões | Descrição |
|---|---|---|
apiserver_storage_objects |
ClusterName |
O número de objetos armazenados no etcd pelo servidor de API. |
apiserver_request_total |
ClusterName |
O número total de solicitações recebidas pelo servidor de API. |
apiserver_request_duration_seconds |
ClusterName |
A latência das solicitações do servidor de API, em segundos. |