

# Referencia de métricas de OpenTelemetry de Información de SageMaker AI
<a name="SageMaker-AI-Insights-Metrics"></a>

En esta sección se proporciona una lista completa de las métricas de OpenTelemetry emitidas por la observabilidad detallada de SageMaker AI. La observabilidad detallada se basa en OpenTelemetry (OTel) y recopila métricas operativas detalladas de las capas de GPU, nodos y marco de inferencia y las publica en CloudWatch con etiquetas enriquecidas.

**nota**  
La observabilidad detallada publica las métricas de OpenTelemetry (OTel) en CloudWatch mediante OTLP. Estas no son métricas de Prometheus. Las métricas se almacenan de forma nativa en CloudWatch como datos de métricas de OTel y se pueden consultar mediante la sintaxis PromQL.

## Métricas de agregación de nivel de cuenta
<a name="SageMaker-AI-Insights-Metrics-account"></a>


| Métrica | Tipo | Descripción | 
| --- | --- | --- | 
| TotalEndpoints | Agregado | Recuento de todos los puntos de conexión de la cuenta | 
| TotalICs | Agregado | Recuento de todos los componentes de inferencia | 
| TotalGPUs | Agregado | Recuento de todas las GPU (derivadas de DCGM\_FI\_DEV\_GPU\_UTIL) | 

## Métricas de nivel de punto de conexión
<a name="SageMaker-AI-Insights-Metrics-endpoint"></a>


| Métrica | Tipo | Descripción | 
| --- | --- | --- | 
| InstanceCountPerEndpoint | Agregado | Recuento de instancias que atienden tráfico | 
| InstancesPerAZ | Agregado | Instancias por zona de disponibilidad | 
| EmptyInstanceCount | Agregado | Instancias sin componentes de inferencia colocados | 
| ScalingAction | Raw | Evento de escalado (entrada/salida) | 
| ICECount | Raw | Recuento de errores de capacidad insuficiente | 
| CPUUtilization (EP) | Agregado | Utilización de la CPU a nivel de punto de conexión | 
| MemoryUtilization (EP) | Agregado | Utilización de memoria a nivel de punto de conexión | 
| DiskUtilization (EP) | Agregado | Utilización del disco a nivel de punto de conexión | 
| E2EScalingLatency | Raw | Duración del escalado de extremo a extremo | 
| RebalancingType | Raw | Tipo de evento de reequilibrio | 
| RebalancingDuration | Raw | Duración del reequilibrio (segundos) | 
| RebalancingCopiesMoved | Raw | Las copias de componentes de inferencia se movieron durante el reequilibrio | 
| AZSkewDelta | Raw | Desequilibrio de distribución por zonas de disponibilidad | 
| InstancesReleased | Raw | Instancias liberadas mediante el reequilibrio | 

## Métricas del marco de inferencia (vLLM/SGLang)
<a name="SageMaker-AI-Insights-Metrics-framework"></a>


| Métrica | Tipo | Descripción | 
| --- | --- | --- | 
| InputTokensPerSecond | Agregado | Velocidad de los tokens de entrada | 
| OutputTokensPerSecond | Agregado | Velocidad de los tokens de salida | 
| TotalTPS | Agregado | Tokens totales por segundo | 
| TPSUtilization | Agregado | Porcentaje de utilización de TPS | 
| TTFT | Raw | Tiempo transcurrido hasta el primer token (histograma) | 
| InterTokenLatency | Raw | Latencia entre tokens (histograma) | 
| KVCacheUtilization | Raw | Porcentaje de uso de caché KV | 
| QueueDepth | Raw | Solicitudes en espera (cola) | 
| BatchSize | Raw | Solicitudes en ejecución (durante el vuelo) | 
| TPSPerInstance | Agregado | TPS agregados por instancia | 
| ConcurrentReqsPerCopy | Raw | Solicitudes durante el vuelo por copia | 
| FirstChunkLatencyPerIC | Raw | TTFT por componente de inferencia | 
| 4XXErrorRatePerIC | Agregado | Errores de cliente por componente de inferencia | 
| 5XXErrorRatePerIC | Agregado | Errores de servidor por componente de inferencia | 
| TTFTPerIC | Raw | TTFT filtrada por componente de inferencia | 
| ITLPerIC | Raw | ITL filtrada por componente de inferencia | 
| InputTPSPerIC | Agregado | TPS de entrada por componente de inferencia | 
| OutputTPSPerIC | Agregado | TPS de salida por componente de inferencia | 
| KVCachePerIC | Raw | Caché KV por componente de inferencia | 
| ModelErrorBreakdown | Agregado | Desglose de errores por tipo | 

**nota**  
`TTFT` y `InterTokenLatency` dependen del marco y solo son compatibles con vLLM y SGLang.

## Métricas de GPU (DCGM)
<a name="SageMaker-AI-Insights-Metrics-gpu"></a>

Estas métricas se recopilan del exportador de Data Center GPU Manager (DCGM) de NVIDIA. Están disponibles en todos los puntos de conexión de la GPU independientemente del marco de inferencia.


| Métrica | Tipo | Descripción | 
| --- | --- | --- | 
| DCGM\_FI\_DEV\_GPU\_UTIL | Raw | Uso de la GPU (%) | 
| DCGM\_FI\_DEV\_MEM\_COPY\_UTIL | Raw | Utilización de la copia de memoria (%) | 
| DCGM\_FI\_DEV\_GPU\_TEMP | Raw | Temperatura de la GPU (°C) | 
| DCGM\_FI\_DEV\_MEMORY\_TEMP | Raw | Temperatura de la memoria (°C) | 
| DCGM\_FI\_DEV\_FB\_FREE | Raw | Memoria de framebuffer disponible (bytes) | 
| DCGM\_FI\_DEV\_FB\_USED | Raw | Memoria de framebuffer utilizada (bytes) | 
| DCGM\_FI\_DEV\_SM\_ACTIVE | Raw | Multiprocesador de flujo activo (%) | 

## Métricas de nodos (instancias)
<a name="SageMaker-AI-Insights-Metrics-node"></a>

Estas métricas se recopilan del exportador de nodos. Proporcionan visibilidad a nivel de instancia del uso de la CPU, la memoria y el disco.


| Métrica | Tipo | Descripción | 
| --- | --- | --- | 
| node\_cpu\_seconds\_total | Raw | Tiempo de CPU por modo y núcleo (segundos) | 
| node\_memory\_MemTotal\_bytes | Raw | Memoria total (bytes) | 
| node\_memory\_MemAvailable\_bytes | Raw | Memoria disponible (bytes) | 
| node\_filesystem\_size\_bytes | Raw | Tamaño total del sistema de archivos (bytes) | 
| node\_filesystem\_avail\_bytes | Raw | Espacio disponible del sistema de archivos (bytes) | 

## Métricas de ubicación de alta disponibilidad y componentes de inferencia
<a name="SageMaker-AI-Insights-Metrics-ha"></a>


| Métrica | Tipo | Descripción | 
| --- | --- | --- | 
| ICCopyCountPerAZ | Agregado | Copias de componentes de inferencia por zona de disponibilidad | 
| ICCopiesPerAZ | Agregado | Copias de componentes de inferencia por zona de disponibilidad (vista alternativa) | 
| AZSkewScore | Agregado | Puntuación de desequilibrio de zonas de disponibilidad | 
| AZBalanceScore | Agregado | Equilibro a nivel de punto de conexión | 
| ICDensityPerAZ | Agregado | Densidad de componentes de inferencia por zona de disponibilidad | 
| ICCopiesPerInstance | Agregado | Copias de componentes de inferencia por instancia | 
| ICListPerInstance | Agregado | Qué componentes de inferencia hay en qué instancia | 

## Métricas de ciclo de vida y aprovisionamiento
<a name="SageMaker-AI-Insights-Metrics-lifecycle"></a>


| Métrica | Tipo | Descripción | 
| --- | --- | --- | 
| ModelDownloadTime | Raw | Tiempo para que se descarguen las instancias en Amazon S3 | 
| GPULoadTime | Raw | Tiempo para que las ponderaciones pasen a la memoria de GPU | 
| ContainerStartDuration | Raw | Inicio del contenedor hasta la comprobación de estado | 
| ColdStartDuration | Raw | De extremo a extremo: desde la creación hasta la primera invocación | 

## Las métricas solo están disponibles como métricas clásicas de CloudWatch
<a name="SageMaker-AI-Insights-Metrics-classic"></a>

Las siguientes métricas solo están disponibles como métricas clásicas de CloudWatch (modelo de espacio de nombres y dimensiones) y requieren el enriquecimiento de OTel para que aparezcan como métricas de OpenTelemetry.


| Métrica | Notas | 
| --- | --- | 
| InvocationsPerIC | Bloqueado para la emisión directa de OpenTelemetry | 
| InvocationsPerCopy | Blocked | 
| ModelLatencyPerIC | Bloqueado: utilice vllm:e2e\_request\_latency\_seconds como alternativa de OTel | 
| OverheadLatencyPerIC | Blocked | 
| MidStreamErrorsPerIC | Bloqueado (solo flujo bidireccional) | 