

Le traduzioni sono generate tramite traduzione automatica. In caso di conflitto tra il contenuto di una traduzione e la versione originale in Inglese, quest'ultima prevarrà.

# CloudWatch SageMaker Approfondimenti sull'IA
<a name="SageMaker-Insights"></a>

Usa CloudWatch SageMaker AI Insights per monitorare e risolvere i problemi degli endpoint di inferenza AI su larga scala SageMaker . La dashboard mostra metriche e visualizzazioni curate su tre visualizzazioni: **prestazioni**, **capacità** e **affidabilità, in modo da poter identificare rapidamente i problemi, ottimizzare l'utilizzo delle risorse e garantire** un'elevata disponibilità sugli endpoint.

SageMaker AI Insights supporta il monitoraggio tra tipi di endpoint (endpoint a modello singolo e endpoint basati su componenti di inferenza (IC)) e framework di inferenza (vLLM, Sglang, TensorRT‐LLM).

Per SageMaker iniziare a usare AI Insights, consulta i seguenti argomenti.

**Argomenti**
+ [Inizia a usare CloudWatch SageMaker AI Insights](SageMaker-AI-Insights-Get-Started.md)
+ [SageMaker Dashboard di AI Insights](SageMaker-AI-Insights-Dashboard.md)
+ [SageMaker Riferimento alle OpenTelemetry metriche di AI Insights](SageMaker-AI-Insights-Metrics.md)
+ [Risoluzione dei problemi di SageMaker AI Insights](SageMaker-AI-Insights-Troubleshooting.md)

## Funzionalità chiave
<a name="SageMaker-AI-Insights-capabilities"></a>
+ **OpenTelemetry‐collezione nativa.** Le metriche vengono raccolte utilizzando un OTel Collector che estrae gli endpoint Prometheus da DCGM (metriche GPU), dagli esportatori di nodi (CPU, memoria, disco) e dai contenitori del framework di inferenza (VLLm, Sglang).
+ **Etichette dimensionali ricche.** Ogni metrica include etichette come`aws.sagemaker.endpoint.name`,`aws.sagemaker.inference_component.name`, `@resource.host.id``@resource.cloud.availability_zone`, e`@resource.host.type`.
+ **Attribuzione per GPU.** Le metriche GPU (DCGM) includono l'attribuzione per componente di inferenza per istanze multi-tenant.
+ **Metriche del framework di inferenza.** Metriche native di VLLM e SGlang: token al secondo, TTFT (time to first token), latenza tra token, utilizzo della cache KV, profondità della coda, dimensione del batch, senza strumentazione personalizzata.
+ **Supporto per query PromQL.** Esegui una CloudWatch query in CloudWatch, Query Studio o Amazon Managed Grafana.
+ **Frequenza di scraping configurabile.** Imposta tramite `MetricPublishFrequencyInSeconds` (10, 30, 60, 120, 180, 240 o 300 secondi; impostazione predefinita 60). Le metriche del piano di controllo sono basate sugli eventi.

## Architettura e flusso di dati
<a name="SageMaker-AI-Insights-architecture"></a>

1. Il **contenitore del modello**, l'esportatore **DCGM e l'esportatore** di **nodi espongono le metriche compatibili con Prometheus** sull'istanza.

1. L'**Otel Collector** analizza questi endpoint e arricchisce ogni metrica con etichette (nome dell'endpoint, nome IC, ID dell'istanza, AZ).

1. **Le metriche arricchite vengono esportate tramite OTLP in.** CloudWatch

1. **Le metriche sono interrogabili tramite PromQL in.** CloudWatch

```
┌─────────────────────────────────────────────────────────────────┐
│  SageMaker Endpoint Instance                                      │
│                                                                   │
│  ┌──────────────┐  ┌──────────────┐  ┌──────────────────────┐    │
│  │ Model        │  │ DCGM         │  │ Node Exporter        │    │
│  │ Container    │  │ Exporter     │  │ (CPU/Mem/Disk)       │    │
│  │ (vLLM/SGLang)│  │ (GPU)        │  │                      │    │
│  └──────┬───────┘  └──────┬───────┘  └──────────┬───────────┘    │
│         │                 │                     │                 │
│         └─────────────────┼─────────────────────┘                 │
│                           ▼                                       │
│              ┌─────────────────────────┐                          │
│              │   OTel Collector        │                          │
│              │   (scrape + enrich)     │                          │
│              └────────────┬────────────┘                          │
└───────────────────────────┼───────────────────────────────────────┘
                            │ OTLP
                            ▼
              ┌─────────────────────────┐
              │   Amazon CloudWatch     │
              │   (PromQL-queryable)    │
              └─────────────────────────┘
```

## Come accedere
<a name="SageMaker-AI-Insights-access"></a>

Puoi aprire SageMaker AI Insights dalla console SageMaker AI utilizzando uno dei seguenti percorsi.


| Origine | Azione | Destinazione | 
| --- | --- | --- | 
| SageMaker Console AI → Elenco degli endpoint | Scegli Open SageMaker AI Insights | Dashboard a livello di flotta (senza filtro) | 
| SageMaker Console AI → pagina dei dettagli dell'endpoint | Scegli Visualizza in SageMaker AI Insights | Dashboard filtrata in base a quell'endpoint | 
| SageMaker Console AI → scheda IC → riga per IC | Scegli Metriche | Dashboard filtrato in base all'endpoint e al componente di inferenza | 

**Puoi anche navigare direttamente nella CloudWatch console selezionando **Monitoraggio dell'infrastruttura** → SageMaker AI Insights.**

## Prerequisiti
<a name="SageMaker-AI-Insights-prerequisites"></a>
+ Almeno un endpoint di inferenza SageMaker AI nello stato `InService`
+ `EnableDetailedObservability`impostato `true` su on the endpoint configuration (impostazione predefinita per i nuovi endpoint)
+ L'arricchimento di OTel è abilitato nel tuo account
+ Le autorizzazioni `cloudwatch:GetMetricData` e `cloudwatch:ListMetrics` IAM

Per ulteriori informazioni, consulta [Inizia a usare CloudWatch SageMaker AI Insights](SageMaker-AI-Insights-Get-Started.md).

## Prezzi
<a name="SageMaker-AI-Insights-pricing"></a>

CloudWatch OpenTelemetry si applica l'ingestione metrica. Per ulteriori informazioni, consulta la pagina [ CloudWatch dei prezzi di Amazon](https://aws.amazon.com/cloudwatch/pricing/).