View a markdown version of this page

CloudWatch SageMaker Approfondimenti sull'IA - Amazon CloudWatch

Le traduzioni sono generate tramite traduzione automatica. In caso di conflitto tra il contenuto di una traduzione e la versione originale in Inglese, quest'ultima prevarrà.

CloudWatch SageMaker Approfondimenti sull'IA

Usa CloudWatch SageMaker AI Insights per monitorare e risolvere i problemi degli endpoint di inferenza AI su larga scala SageMaker . La dashboard mostra metriche e visualizzazioni curate su tre visualizzazioni: prestazioni, capacità e affidabilità, in modo da poter identificare rapidamente i problemi, ottimizzare l'utilizzo delle risorse e garantire un'elevata disponibilità sugli endpoint.

SageMaker AI Insights supporta il monitoraggio tra tipi di endpoint (endpoint a modello singolo e endpoint basati su componenti di inferenza (IC)) e framework di inferenza (vLLM, Sglang, TensorRT‐LLM).

Per SageMaker iniziare a usare AI Insights, consulta i seguenti argomenti.

Funzionalità chiave

  • OpenTelemetry‐collezione nativa. Le metriche vengono raccolte utilizzando un OTel Collector che estrae gli endpoint Prometheus da DCGM (metriche GPU), dagli esportatori di nodi (CPU, memoria, disco) e dai contenitori del framework di inferenza (VLLm, Sglang).

  • Etichette dimensionali ricche. Ogni metrica include etichette comeaws.sagemaker.endpoint.name,aws.sagemaker.inference_component.name, @resource.host.id@resource.cloud.availability_zone, e@resource.host.type.

  • Attribuzione per GPU. Le metriche GPU (DCGM) includono l'attribuzione per componente di inferenza per istanze multi-tenant.

  • Metriche del framework di inferenza. Metriche native di VLLM e SGlang: token al secondo, TTFT (time to first token), latenza tra token, utilizzo della cache KV, profondità della coda, dimensione del batch, senza strumentazione personalizzata.

  • Supporto per query PromQL. Esegui una CloudWatch query in CloudWatch, Query Studio o Amazon Managed Grafana.

  • Frequenza di scraping configurabile. Imposta tramite MetricPublishFrequencyInSeconds (10, 30, 60, 120, 180, 240 o 300 secondi; impostazione predefinita 60). Le metriche del piano di controllo sono basate sugli eventi.

Architettura e flusso di dati

  1. Il contenitore del modello, l'esportatore DCGM e l'esportatore di nodi espongono le metriche compatibili con Prometheus sull'istanza.

  2. L'Otel Collector analizza questi endpoint e arricchisce ogni metrica con etichette (nome dell'endpoint, nome IC, ID dell'istanza, AZ).

  3. Le metriche arricchite vengono esportate tramite OTLP in. CloudWatch

  4. Le metriche sono interrogabili tramite PromQL in. CloudWatch

┌─────────────────────────────────────────────────────────────────┐ │ SageMaker Endpoint Instance │ │ │ │ ┌──────────────┐ ┌──────────────┐ ┌──────────────────────┐ │ │ │ Model │ │ DCGM │ │ Node Exporter │ │ │ │ Container │ │ Exporter │ │ (CPU/Mem/Disk) │ │ │ │ (vLLM/SGLang)│ │ (GPU) │ │ │ │ │ └──────┬───────┘ └──────┬───────┘ └──────────┬───────────┘ │ │ │ │ │ │ │ └─────────────────┼─────────────────────┘ │ │ ▼ │ │ ┌─────────────────────────┐ │ │ │ OTel Collector │ │ │ │ (scrape + enrich) │ │ │ └────────────┬────────────┘ │ └───────────────────────────┼───────────────────────────────────────┘ │ OTLP ▼ ┌─────────────────────────┐ │ Amazon CloudWatch │ │ (PromQL-queryable) │ └─────────────────────────┘

Come accedere

Puoi aprire SageMaker AI Insights dalla console SageMaker AI utilizzando uno dei seguenti percorsi.

Origine Azione Destinazione
SageMaker Console AI → Elenco degli endpoint Scegli Open SageMaker AI Insights Dashboard a livello di flotta (senza filtro)
SageMaker Console AI → pagina dei dettagli dell'endpoint Scegli Visualizza in SageMaker AI Insights Dashboard filtrata in base a quell'endpoint
SageMaker Console AI → scheda IC → riga per IC Scegli Metriche Dashboard filtrato in base all'endpoint e al componente di inferenza

Puoi anche navigare direttamente nella CloudWatch console selezionando Monitoraggio dell'infrastruttura → SageMaker AI Insights.

Prerequisiti

  • Almeno un endpoint di inferenza SageMaker AI nello stato InService

  • EnableDetailedObservabilityimpostato true su on the endpoint configuration (impostazione predefinita per i nuovi endpoint)

  • L'arricchimento di OTel è abilitato nel tuo account

  • Le autorizzazioni cloudwatch:GetMetricData e cloudwatch:ListMetrics IAM

Per ulteriori informazioni, consulta Inizia a usare CloudWatch SageMaker AI Insights.

Prezzi

CloudWatch OpenTelemetry si applica l'ingestione metrica. Per ulteriori informazioni, consulta la pagina CloudWatch dei prezzi di Amazon.