View a markdown version of this page

Riferimento metrico Enhanced Container Insights (Classic) - Amazon CloudWatch

Le traduzioni sono generate tramite traduzione automatica. In caso di conflitto tra il contenuto di una traduzione e la versione originale in Inglese, quest'ultima prevarrà.

Riferimento metrico Enhanced Container Insights (Classic)

Enhanced Container Insights (Classic) pubblica le metriche nello spazio dei nomi in. ContainerInsights CloudWatch Le tabelle seguenti elencano tutte le metriche per categoria, insieme alle relative dimensioni e descrizioni.

Nota

Per le metriche di Otel Container Insights, vediOtel Container Insights (consigliato), che elenca i nomi delle metriche open source.

Parametri cluster

Le seguenti metriche misurano lo stato e la capacità complessive del tuo cluster Amazon EKS.

Nome parametro Dimensioni Description
cluster_failed_node_count ClusterName Il numero di nodi di lavoro non riusciti nel cluster.
cluster_node_count ClusterName Il numero totale di nodi di lavoro nel cluster.

Metriche dei nodi

Le seguenti metriche misurano l'utilizzo e la capacità delle risorse a livello di nodo.

Nome parametro Dimensioni Description
node_cpu_limit ClusterName, InstanceId, NodeName Il numero massimo di unità CPU che possono essere assegnate al nodo.
node_cpu_reserved_capacity ClusterName, InstanceId, NodeName La percentuale di unità CPU riservate sul nodo.
node_cpu_usage_total ClusterName, InstanceId, NodeName Il numero di unità CPU utilizzate nel nodo.
node_cpu_utilization ClusterName, InstanceId, NodeName La percentuale di unità CPU utilizzate nel nodo.
node_filesystem_utilization ClusterName, InstanceId, NodeName La percentuale di capacità del file system utilizzata sul nodo.
node_memory_limit ClusterName, InstanceId, NodeName La quantità massima di memoria, in byte, che può essere assegnata al nodo.
node_memory_reserved_capacity ClusterName, InstanceId, NodeName La percentuale di memoria riservata sul nodo.
node_memory_utilization ClusterName, InstanceId, NodeName La percentuale di memoria utilizzata sul nodo.
node_memory_working_set ClusterName, InstanceId, NodeName La quantità di memoria, in byte, nel set di lavoro del nodo.
node_network_total_bytes ClusterName, InstanceId, NodeName Il numero totale di byte al secondo trasmessi e ricevuti tramite la rete sul nodo.
node_number_of_running_containers ClusterName, InstanceId, NodeName Il numero di contenitori in esecuzione sul nodo.
node_number_of_running_pods ClusterName, InstanceId, NodeName Il numero di pod in esecuzione sul nodo.

Metriche dei pod

Le seguenti metriche misurano l'utilizzo delle risorse a livello di pod.

Nome parametro Dimensioni Description
pod_cpu_utilization ClusterName, Namespace, PodName La percentuale di unità CPU utilizzate dal pod.
pod_cpu_utilization_over_pod_limit ClusterName, Namespace, PodName La percentuale di unità CPU utilizzate rispetto al limite del pod.
pod_cpu_usage_total ClusterName, Namespace, PodName Il numero di unità CPU utilizzate dal pod.
pod_memory_utilization ClusterName, Namespace, PodName La percentuale di memoria utilizzata dal pod.
pod_memory_utilization_over_pod_limit ClusterName, Namespace, PodName La percentuale di memoria utilizzata rispetto al limite del pod.
pod_memory_working_set ClusterName, Namespace, PodName La quantità di memoria, in byte, nel set di lavoro del pod.
pod_network_rx_bytes ClusterName, Namespace, PodName Il numero di byte ricevuti al secondo in rete dal pod.
pod_network_tx_bytes ClusterName, Namespace, PodName Il numero di byte trasmessi al secondo in rete dal pod.
pod_number_of_container_restarts ClusterName, Namespace, PodName Il numero totale di riavvii del contenitore nel pod.

Parametri dei container

Le seguenti metriche misurano l'utilizzo delle risorse a livello di contenitore.

Nome parametro Dimensioni Description
container_cpu_utilization ClusterName, Namespace, PodName, ContainerName La percentuale di unità CPU utilizzate dal contenitore.
container_memory_utilization ClusterName, Namespace, PodName, ContainerName La percentuale di memoria utilizzata dal contenitore.

Metriche relative al servizio e al namespace

Le seguenti metriche misurano il numero di pod a livello di servizio e namespace.

Nome parametro Dimensioni Description
service_number_of_running_pods ClusterName, Namespace, Service Il numero di pod in esecuzione per il servizio.
namespace_number_of_running_pods ClusterName, Namespace Il numero di pod in esecuzione nel namespace.

Metriche della GPU NVIDIA

Le seguenti metriche vengono raccolte quando il cluster ha nodi NVIDIA. GPU-equipped Queste metriche consentono di monitorare l'utilizzo del calcolo e della memoria della GPU tra nodi, pod e contenitori.

Nome parametro Dimensioni Description
node_gpu_utilization ClusterName, InstanceId, NodeName La percentuale di capacità di elaborazione della GPU utilizzata sul nodo.
node_gpu_memory_utilization ClusterName, InstanceId, NodeName La percentuale di memoria GPU utilizzata sul nodo.
node_gpu_temperature ClusterName, InstanceId, NodeName La temperatura della GPU in gradi Celsius sul nodo.
pod_gpu_utilization ClusterName, Namespace, PodName La percentuale di capacità di elaborazione della GPU utilizzata dal pod.
container_gpu_utilization ClusterName, Namespace, PodName, ContainerName La percentuale di capacità di elaborazione della GPU utilizzata dal contenitore.

AWS Metriche dei neuroni

Le seguenti metriche vengono raccolte quando il cluster ha AWS Neuron-equipped istanze, come Inf1 o Inf2. Queste metriche consentono di monitorare l' NeuronCore utilizzo a livello di nodo e pod.

Nome parametro Dimensioni Description
node_neuroncore_utilization ClusterName, InstanceId, NodeName La percentuale di capacità di NeuronCore elaborazione utilizzata sul nodo.
pod_neuroncore_utilization ClusterName, Namespace, PodName La percentuale di capacità di NeuronCore elaborazione utilizzata dal pod.

Metriche del server API Kubernetes

Le seguenti metriche vengono raccolte dal server dell'API Kubernetes. Queste metriche ti aiutano a monitorare lo stato e le prestazioni del piano di controllo.

Nome parametro Dimensioni Description
apiserver_storage_objects ClusterName Il numero di oggetti archiviati in etcd dal server API.
apiserver_request_total ClusterName Il numero totale di richieste ricevute dal server API.
apiserver_request_duration_seconds ClusterName La latenza delle richieste del server API, in secondi.