View a markdown version of this page

Référence métrique Enhanced Container Insights (Classic) - Amazon CloudWatch

Les traductions sont fournies par des outils de traduction automatique. En cas de conflit entre le contenu d'une traduction et celui de la version originale en anglais, la version anglaise prévaudra.

Référence métrique Enhanced Container Insights (Classic)

Enhanced Container Insights (Classic) publie les métriques dans CloudWatch l'espace de ContainerInsights noms de. Les tableaux suivants répertorient toutes les mesures par catégorie, ainsi que leurs dimensions et descriptions.

Note

Pour les statistiques d'OTel Container Insights, voirOTel Container Insights (recommandé), qui répertorie les noms des métriques open source.

Métriques du cluster

Les mesures suivantes mesurent l'état général et la capacité de votre cluster Amazon EKS.

Nom de la métrique Dimensions Description
cluster_failed_node_count ClusterName Nombre d'échecs des nœuds de travail dans le cluster.
cluster_node_count ClusterName Nombre total de composants master dans le cluster.

Métriques des nœuds

Les métriques suivantes mesurent l'utilisation des ressources et la capacité au niveau du nœud.

Nom de la métrique Dimensions Description
node_cpu_limit ClusterName, InstanceId, NodeName Nombre maximal d'unités de processeur pouvant être attribuées au nœud.
node_cpu_reserved_capacity ClusterName, InstanceId, NodeName Pourcentage d'unités de processeur réservées sur le nœud.
node_cpu_usage_total ClusterName, InstanceId, NodeName Le nombre d'unités de processeur utilisées sur le nœud.
node_cpu_utilization ClusterName, InstanceId, NodeName Pourcentage d'unités de processeur utilisées sur le nœud.
node_filesystem_utilization ClusterName, InstanceId, NodeName Pourcentage de capacité du système de fichiers utilisé sur le nœud.
node_memory_limit ClusterName, InstanceId, NodeName La quantité maximale de mémoire, en octets, qui peut être attribuée au nœud.
node_memory_reserved_capacity ClusterName, InstanceId, NodeName Pourcentage de mémoire réservée sur le nœud.
node_memory_utilization ClusterName, InstanceId, NodeName Pourcentage de mémoire utilisée sur le nœud.
node_memory_working_set ClusterName, InstanceId, NodeName Quantité de mémoire, en octets, dans l'ensemble de travail du nœud.
node_network_total_bytes ClusterName, InstanceId, NodeName Nombre total d'octets par seconde transmis et reçus sur le réseau sur le nœud.
node_number_of_running_containers ClusterName, InstanceId, NodeName Le nombre de conteneurs en cours d'exécution sur le nœud.
node_number_of_running_pods ClusterName, InstanceId, NodeName Le nombre de pods actifs sur le nœud.

Métriques du pod

Les mesures suivantes mesurent l'utilisation des ressources au niveau du pod.

Nom de la métrique Dimensions Description
pod_cpu_utilization ClusterName, Namespace, PodName Pourcentage d'unités de processeur utilisées par le pod.
pod_cpu_utilization_over_pod_limit ClusterName, Namespace, PodName Pourcentage d'unités de processeur utilisées par rapport à la limite de modules.
pod_cpu_usage_total ClusterName, Namespace, PodName Nombre d'unités de processeur utilisées par le pod.
pod_memory_utilization ClusterName, Namespace, PodName Pourcentage de mémoire utilisé par le pod.
pod_memory_utilization_over_pod_limit ClusterName, Namespace, PodName Pourcentage de mémoire utilisée par rapport à la limite de modules.
pod_memory_working_set ClusterName, Namespace, PodName Quantité de mémoire, en octets, dans l'ensemble de travail du pod.
pod_network_rx_bytes ClusterName, Namespace, PodName Nombre d'octets reçus par seconde sur le réseau par le pod.
pod_network_tx_bytes ClusterName, Namespace, PodName Nombre d'octets transmis par seconde sur le réseau par le pod.
pod_number_of_container_restarts ClusterName, Namespace, PodName Le nombre total de conteneurs redémarrant dans le pod.

Métriques de conteneur

Les mesures suivantes mesurent l'utilisation des ressources au niveau du conteneur.

Nom de la métrique Dimensions Description
container_cpu_utilization ClusterName, Namespace, PodName, ContainerName Pourcentage d'unités de processeur utilisées par le conteneur.
container_memory_utilization ClusterName, Namespace, PodName, ContainerName Pourcentage de mémoire utilisé par le conteneur.

Métriques de service et d'espace de noms

Les métriques suivantes mesurent le nombre de pods au niveau du service et de l'espace de noms.

Nom de la métrique Dimensions Description
service_number_of_running_pods ClusterName, Namespace, Service Le nombre de modules actifs pour le service.
namespace_number_of_running_pods ClusterName, Namespace Le nombre de pods actifs dans l'espace de noms.

Métriques des GPU NVIDIA

Les métriques suivantes sont collectées lorsque votre cluster possède des GPU-equipped nœuds NVIDIA. Ces indicateurs vous aident à surveiller le calcul du GPU et l'utilisation de la mémoire sur les nœuds, les pods et les conteneurs.

Nom de la métrique Dimensions Description
node_gpu_utilization ClusterName, InstanceId, NodeName Pourcentage de capacité de calcul du GPU utilisée sur le nœud.
node_gpu_memory_utilization ClusterName, InstanceId, NodeName Pourcentage de mémoire GPU utilisé sur le nœud.
node_gpu_temperature ClusterName, InstanceId, NodeName Température du GPU en degrés Celsius sur le nœud.
pod_gpu_utilization ClusterName, Namespace, PodName Pourcentage de capacité de calcul du GPU utilisé par le module.
container_gpu_utilization ClusterName, Namespace, PodName, ContainerName Pourcentage de capacité de calcul du GPU utilisé par le conteneur.

AWS Métriques neuronales

Les métriques suivantes sont collectées lorsque votre cluster possède des AWS Neuron-equipped instances, telles que Inf1 ou Inf2. Ces mesures vous aident à surveiller NeuronCore l'utilisation au niveau du nœud et du pod.

Nom de la métrique Dimensions Description
node_neuroncore_utilization ClusterName, InstanceId, NodeName Pourcentage de capacité de NeuronCore calcul utilisée sur le nœud.
pod_neuroncore_utilization ClusterName, Namespace, PodName Pourcentage de capacité de NeuronCore calcul utilisée par le module.

Statistiques du serveur d'API Kubernetes

Les métriques suivantes sont collectées à partir du serveur d'API Kubernetes. Ces mesures vous aident à surveiller l'état et les performances du plan de contrôle.

Nom de la métrique Dimensions Description
apiserver_storage_objects ClusterName Le nombre d'objets stockés dans etcd par le serveur API.
apiserver_request_total ClusterName Nombre total de demandes reçues par le serveur d'API.
apiserver_request_duration_seconds ClusterName Latence des demandes du serveur d'API, en secondes.