View a markdown version of this page

Risoluzione dei problemi relativi a Container Insights su Amazon EKS - Amazon CloudWatch

Le traduzioni sono generate tramite traduzione automatica. In caso di conflitto tra il contenuto di una traduzione e la versione originale in Inglese, quest'ultima prevarrà.

Risoluzione dei problemi relativi a Container Insights su Amazon EKS

Questa sezione descrive i problemi più comuni che potresti riscontrare durante la configurazione o la gestione di Container Insights su Amazon EKS. Utilizza le tabelle e i comandi diagnostici seguenti per identificare e risolvere i problemi indipendentemente dal fatto che utilizzi l'approccio OTel o Classic.

Per una guida alla configurazione specifica per ogni approccio, consulta o. Avvio rapido: Otel Container Insights su Amazon EKS Guida all'installazione (AWS CLI) Per confrontare gli approcci, vedere. Confronta gli approcci di Container

Le metriche non compaiono in CloudWatch

Se non vedi le metriche nel ContainerInsights namespace, utilizza la tabella seguente per identificare la causa.

Caratteristiche Causa Risoluzione
Nessuna metrica nel namespace ContainerInsights Il ruolo IAM non ha l'autorizzazione cloudwatch:PutMetricData Allega la policy CloudWatchAgentServerPolicy gestita al ruolo IAM dell'agente.
Le metriche vengono visualizzate per alcuni nodi ma non per altri L'agente DaemonSet non è programmato su tutti i nodi a causa di problemi Aggiungi tolleranze all'agente DaemonSet per consentire la pianificazione sui nodi contaminati.
Le metriche smettono di apparire Il pod dell'agente è OOMKilled o si sta riavviando Aumenta i limiti di memoria nella specifica delle risorse del pod dell'agente.
Le metriche sono obsolete o pari a zero La connettività di rete è bloccata Controlla i gruppi di sicurezza VPC e verifica che esista un endpoint CloudWatch VPC.
Mancano metriche avanzate Agente non configurato per una migliore osservabilità Impostato enhancedObservability: true nella configurazione dell'agente.

I pod dell'agente non si avviano

Se gli agent pod non si avviano o rimangono in uno stato non in esecuzione, utilizzate la tabella seguente per diagnosticare il problema.

Caratteristiche Causa Risoluzione
ImagePullBackOff Amazon ECR non è raggiungibile o il tag dell'immagine non è corretto Verifica l'URI dell'immagine e conferma che i tuoi nodi possano accedere ad Amazon ECR.
Pending CPU o memoria insufficienti sul nodo Ridimensiona il gruppo di nodi o riduci le richieste di risorse nella specifica del pod dell'agente.
CrashLoopBackOff Configurazione non valida o montaggio del volume mancante Controlla i log del pod per verificare la presenza di errori di configurazione eseguendoli kubectl logs sul pod interessato.
FailedScheduling L'affinità o i difetti dei nodi impediscono la pianificazione Esamina le tolleranze nodeSelector e le tolleranze nelle specifiche. DaemonSet
Codice di uscita 1 All'account del servizio manca l'annotazione IRSA Verifica che l'account del servizio abbia l'annotazioneeks.amazonaws.com/role-arn.

Add-on errori di installazione

Se l'installazione del amazon-cloudwatch-observability componente aggiuntivo non riesce o riporta uno stato non integro, utilizzate la tabella seguente per la risoluzione dei problemi.

Caratteristiche Causa Risoluzione
CREATE_FAILED Risorse in conflitto derivanti da un'installazione precedente Elimina le risorse in conflitto e utilizzale --resolve-conflicts OVERWRITE quando crei il componente aggiuntivo.
Provider OIDC non trovato Non esiste alcun provider di identità IAM OIDC per il cluster Crea il provider eseguendo. eksctl utils associate-iam-oidc-provider
Conflitto di versioni Add-on la versione non è compatibile con la versione di Kubernetes Elenca le versioni compatibili eseguendo. aws eks describe-addon-versions
Stato di DEGRADED I controlli sanitari non riescono a causa della mancanza di autorizzazioni Controlla i log dei pod e verifica che al ruolo IRSA siano allegate le politiche richieste.

Problemi relativi alla consegna dei log

Se i log dei container non vengono visualizzati in Amazon CloudWatch Logs, utilizza la tabella seguente per identificare la causa.

Caratteristiche Causa Risoluzione
Il gruppo di log non esiste logs:CreateLogGroupAutorizzazione mancante Aggiungi le autorizzazioni Amazon CloudWatch Logs al ruolo IAM dell'agente.
Il gruppo di log esiste ma è vuoto L'agente non è configurato per i log o la mancata corrispondenza della regione Verifica che la configurazione dell'agente includa la raccolta dei log e che la regione corrisponda alla regione del cluster.
I log vengono ritardati di oltre 5 minuti L'intervallo di lavaggio è troppo elevato o il nodo è sottoposto a un carico intenso Ridurre il force_flush_interval valore nella configurazione dell'agente.
Mancano i registri delle prestazioni L'agente è configurato solo per i registri delle applicazioni Verificate che la sezione del registro delle prestazioni di Container Insights sia presente nella configurazione dell'agente.

Migration-specific problemi

Se riscontri problemi durante la migrazione tra approcci di Container Insights, utilizza la tabella seguente. Per il flusso di lavoro completo di migrazione, consultaGuide alla migrazione.

Caratteristiche Causa Risoluzione
Metriche duplicate durante l'esecuzione parallela Entrambi gli approcci prevedono la pubblicazione simultanea delle metriche Questo comportamento è previsto durante un'esecuzione parallela. Disattivate l'approccio precedente dopo aver convalidato il nuovo approccio.
Valori metrici diversi tra gli approcci Metodi di calcolo diversi Sono previste piccole differenze (meno del 5%). Grandi differenze indicano una mancata corrispondenza di configurazione tra gli approcci.
Il rollback fallisce La configurazione personalizzata non è stata riapplicata Re-apply i tuoi valori di configurazione completi quando esegui il rollback.
Gli allarmi si attivano durante la migrazione Lacune metriche durante il periodo di transizione Imposta temporaneamente il trattamento dei dati mancanti sugli allarmi interessati. notBreaching

Problemi con Otel Container Insights

I seguenti problemi sono specifici dell'approccio di Otel Container Insights. Per indicazioni generali sulla configurazione, vedereAvvio rapido: Otel Container Insights su Amazon EKS.

Caratteristiche Causa Risoluzione
Errore 403 Forbidden Exporter Al ruolo IAM mancano le autorizzazioni CloudWatch Verifica che CloudWatchAgentServerPolicy sia associato al ruolo di agente.
Connessione rifiutata sull'endpoint di metrics Collector non può raggiungere il kubelet Verifica che hostNetwork: true sia impostato nelle specifiche del pod o conferma che l'account del servizio disponga delle autorizzazioni richieste.
Elevato utilizzo della memoria La coda del processore Batch è troppo grande Riducete i batch/send_batch_size valori batch/timeout and nella configurazione del collettore.
Le metriche personalizzate non vengono visualizzate Ricevitore non configurato per l'endpoint dell'applicazione Aggiungi un ricevitore Prometheus destinato alla porta delle metriche dell'applicazione nella configurazione del collettore.

Comandi diagnostici generali

Utilizza i seguenti comandi per raccogliere informazioni sulla distribuzione di Container Insights.

Per controllare lo stato del pod dell'agente, esegui il comando seguente.

kubectl get pods -n amazon-cloudwatch

Per visualizzare i log dei pod degli agenti, esegui il comando seguente.

kubectl logs -n amazon-cloudwatch -l app.kubernetes.io/name=cloudwatch-agent --tail=50

Per verificare DaemonSet lo stato dell'agente, esegui il comando seguente.

kubectl get daemonset -n amazon-cloudwatch

Per verificare il ruolo IAM su un account di servizio, esegui il comando seguente.

kubectl get serviceaccount -n amazon-cloudwatch -o yaml

Per verificare lo stato del componente aggiuntivo del cluster, esegui il comando seguente. Sostituisci cluster-name con il nome del tuo cluster Amazon EKS.

aws eks describe-addon --cluster-name cluster-name --addon-name amazon-cloudwatch-observability

Per elencare i gruppi di log di Container Insights, esegui il comando seguente. Sostituisci cluster-name con il nome del tuo cluster Amazon EKS.

aws logs describe-log-groups --log-group-name-prefix "/aws/containerinsights/cluster-name"

Per ulteriori informazioni sulla configurazione e l'utilizzo di Container Insights su Amazon EKS, consulta i seguenti argomenti.