

Le traduzioni sono generate tramite traduzione automatica. In caso di conflitto tra il contenuto di una traduzione e la versione originale in Inglese, quest'ultima prevarrà.

# SageMaker Riferimento alle OpenTelemetry metriche di AI Insights
<a name="SageMaker-AI-Insights-Metrics"></a>

Questa sezione fornisce un elenco completo delle OpenTelemetry metriche emesse dall'osservabilità dettagliata dell'IA. SageMaker L'osservabilità dettagliata è basata su OpenTelemetry (OtEL) e raccoglie metriche operative granulari dai livelli di GPU, nodo e framework di inferenza, pubblicandole con etichette complete. CloudWatch 

**Nota**  
L'osservabilità dettagliata pubblica le metriche (OtEL) tramite OTLP. OpenTelemetry CloudWatch Queste non sono metriche di Prometheus. Le metriche sono archiviate nativamente CloudWatch come dati metrici OTel e possono essere interrogate utilizzando la sintassi PromQL.

## Account-level metriche aggregate
<a name="SageMaker-AI-Insights-Metrics-account"></a>


| Metrica | Tipo | Description | 
| --- | --- | --- | 
| TotalEndpoints | Aggregazione | Conteggio di tutti gli endpoint dell'account | 
| TotalICs | Aggregazione | Conteggio di tutti i componenti di inferenza | 
| TotalGPUs | Aggregazione | Numero di tutte le GPU (derivate da) DCGM\_FI\_DEV\_GPU\_UTIL | 

## Endpoint-level metriche
<a name="SageMaker-AI-Insights-Metrics-endpoint"></a>


| Metrica | Tipo | Description | 
| --- | --- | --- | 
| InstanceCountPerEndpoint | Aggregazione | Numero di istanze che servono il traffico | 
| InstancesPerAZ | Aggregazione | Istanze per zona di disponibilità | 
| EmptyInstanceCount | Aggregazione | Istanze senza IC posizionati | 
| ScalingAction | Raw | Evento di scalabilità () in/out | 
| ICECount | Raw | Numero di errori di capacità insufficiente | 
| CPUUtilization(EP) | Aggregazione | Endpoint-level Utilizzo della CPU | 
| MemoryUtilization(EP) | Aggregazione | Endpoint-level utilizzo della memoria | 
| DiskUtilization(EP) | Aggregazione | Endpoint-level utilizzo del disco | 
| E2EScalingLatency | Raw | End-to-end durata del ridimensionamento | 
| RebalancingType | Raw | Tipo di evento di ribilanciamento | 
| RebalancingDuration | Raw | Durata del ribilanciamento (secondi) | 
| RebalancingCopiesMoved | Raw | Copie IC spostate durante il ribilanciamento | 
| AZSkewDelta | Raw | Squilibrio di distribuzione AZ | 
| InstancesReleased | Raw | Istanze liberate mediante ribilanciamento | 

## Metriche del framework di inferenza (vLLM/SGlang)
<a name="SageMaker-AI-Insights-Metrics-framework"></a>


| Metrica | Tipo | Description | 
| --- | --- | --- | 
| InputTokensPerSecond | Aggregazione | Frequenza del token di input | 
| OutputTokensPerSecond | Aggregazione | Frequenza del token di output | 
| TotalTPS | Aggregazione | Token totali al secondo | 
| TPSUtilization | Aggregazione | Percentuale di utilizzo del TPS | 
| TTFT | Raw | Time to First Token (istogramma) | 
| InterTokenLatency | Raw | Inter-Token Latenza (istogramma) | 
| KVCacheUtilization | Raw | Percentuale di utilizzo della cache KV | 
| QueueDepth | Raw | Richieste in attesa (coda) | 
| BatchSize | Raw | Richieste in corso (in volo) | 
| TPSPerInstance | Aggregazione | TPS aggregato per istanza | 
| ConcurrentReqsPerCopy | Raw | Per-copy richieste in volo | 
| FirstChunkLatencyPerIC | Raw | TTFT per IC | 
| 4XXErrorRatePerIC | Aggregazione | Errori del client per IC | 
| 5XXErrorRatePerIC | Aggregazione | Errori del server per IC | 
| TTFTPerIC | Raw | TTFT filtrato da IC | 
| ITLPerIC | Raw | ITL filtrato da IC | 
| InputTPSPerIC | Aggregazione | Ingresso TPS per IC | 
| OutputTPSPerIC | Aggregazione | Uscita TPS per IC | 
| KVCachePerIC | Raw | Cache KV per IC | 
| ModelErrorBreakdown | Aggregazione | Suddivisione degli errori per tipo | 

**Nota**  
`TTFT`e dipendono dal framework e `InterTokenLatency` sono supportati solo per VLLm e sgLang.

## Metriche GPU (DCGM)
<a name="SageMaker-AI-Insights-Metrics-gpu"></a>

Queste metriche vengono raccolte dall'esportatore NVIDIA Data Center GPU Manager (DCGM). Sono disponibili su tutti gli endpoint GPU indipendentemente dal framework di inferenza.


| Metrica | Tipo | Description | 
| --- | --- | --- | 
| DCGM\_FI\_DEV\_GPU\_UTIL | Raw | Utilizzo della GPU (%) | 
| DCGM\_FI\_DEV\_MEM\_COPY\_UTIL | Raw | Utilizzo della copia di memoria (%) | 
| DCGM\_FI\_DEV\_GPU\_TEMP | Raw | Temperatura della GPU (°C) | 
| DCGM\_FI\_DEV\_MEMORY\_TEMP | Raw | Temperatura della memoria (°C) | 
| DCGM\_FI\_DEV\_FB\_FREE | Raw | Memoria framebuffer libera (byte) | 
| DCGM\_FI\_DEV\_FB\_USED | Raw | Memoria framebuffer utilizzata (byte) | 
| DCGM\_FI\_DEV\_SM\_ACTIVE | Raw | Streaming multiprocessore attivo (%) | 

## Metriche relative ai nodi (istanze)
<a name="SageMaker-AI-Insights-Metrics-node"></a>

Queste metriche vengono raccolte dall'esportatore del nodo. Forniscono visibilità a livello di istanza sull'utilizzo di CPU, memoria e disco.


| Metrica | Tipo | Description | 
| --- | --- | --- | 
| node\_cpu\_seconds\_total | Raw | Tempo di CPU per modalità per core (secondi) | 
| node\_memory\_MemTotal\_bytes | Raw | Memoria totale (byte) | 
| node\_memory\_MemAvailable\_bytes | Raw | Memoria disponibile (byte) | 
| node\_filesystem\_size\_bytes | Raw | Dimensione totale del file system (byte) | 
| node\_filesystem\_avail\_bytes | Raw | Spazio disponibile nel file system (byte) | 

## Metriche di posizionamento HA e IC
<a name="SageMaker-AI-Insights-Metrics-ha"></a>


| Metrica | Tipo | Description | 
| --- | --- | --- | 
| ICCopyCountPerAZ | Aggregazione | Copie IC per AZ | 
| ICCopiesPerAZ | Aggregazione | Copie IC per AZ (visualizzazione alternativa) | 
| AZSkewScore | Aggregazione | Punteggio di squilibrio AZ | 
| AZBalanceScore | Aggregazione | Endpoint-level equilibrio | 
| ICDensityPerAZ | Aggregazione | densità IC per AZ | 
| ICCopiesPerInstance | Aggregazione | Copie IC per istanza | 
| ICListPerInstance | Aggregazione | Quali IC su quale istanza | 

## Metriche relative al ciclo di vita e al provisioning
<a name="SageMaker-AI-Insights-Metrics-lifecycle"></a>


| Metrica | Tipo | Description | 
| --- | --- | --- | 
| ModelDownloadTime | Raw | È ora di scaricare l'istanza da Amazon S3 | 
| GPULoadTime | Raw | Tempo di calcolo dei pesi sulla memoria della GPU | 
| ContainerStartDuration | Raw | Inizia il controllo dello stato del contenitore | 
| ColdStartDuration | Raw | End-to-end: dalla creazione alla prima invocazione | 

## Metriche disponibili solo come metriche classiche CloudWatch
<a name="SageMaker-AI-Insights-Metrics-classic"></a>

Le seguenti metriche sono disponibili solo come metriche CloudWatch classiche (namespace e modello dimensionale) e richiedono l'arricchimento di Otel per apparire come metriche. OpenTelemetry 


| Metrica | Note | 
| --- | --- | 
| InvocationsPerIC | Bloccato dall'emissione diretta OpenTelemetry  | 
| InvocationsPerCopy | Bloccato | 
| ModelLatencyPerIC | Bloccato: da utilizzare vllm:e2e\_request\_latency\_seconds come alternativa all'OtL | 
| OverheadLatencyPerIC | Bloccato | 
| MidStreamErrorsPerIC | Bloccato (solo streaming bidirezionale) | 