View a markdown version of this page

Referencia de métricas de OpenTelemetry de Información de SageMaker AI - Amazon CloudWatch

Referencia de métricas de OpenTelemetry de Información de SageMaker AI

En esta sección se proporciona una lista completa de las métricas de OpenTelemetry emitidas por la observabilidad detallada de SageMaker AI. La observabilidad detallada se basa en OpenTelemetry (OTel) y recopila métricas operativas detalladas de las capas de GPU, nodos y marco de inferencia y las publica en CloudWatch con etiquetas enriquecidas.

nota

La observabilidad detallada publica las métricas de OpenTelemetry (OTel) en CloudWatch mediante OTLP. Estas no son métricas de Prometheus. Las métricas se almacenan de forma nativa en CloudWatch como datos de métricas de OTel y se pueden consultar mediante la sintaxis PromQL.

Métricas de agregación de nivel de cuenta

MétricaTipoDescripción
TotalEndpointsAgregadoRecuento de todos los puntos de conexión de la cuenta
TotalICsAgregadoRecuento de todos los componentes de inferencia
TotalGPUsAgregadoRecuento de todas las GPU (derivadas de DCGM_FI_DEV_GPU_UTIL)

Métricas de nivel de punto de conexión

MétricaTipoDescripción
InstanceCountPerEndpointAgregadoRecuento de instancias que atienden tráfico
InstancesPerAZAgregadoInstancias por zona de disponibilidad
EmptyInstanceCountAgregadoInstancias sin componentes de inferencia colocados
ScalingActionRawEvento de escalado (entrada/salida)
ICECountRawRecuento de errores de capacidad insuficiente
CPUUtilization (EP)AgregadoUtilización de la CPU a nivel de punto de conexión
MemoryUtilization (EP)AgregadoUtilización de memoria a nivel de punto de conexión
DiskUtilization (EP)AgregadoUtilización del disco a nivel de punto de conexión
E2EScalingLatencyRawDuración del escalado de extremo a extremo
RebalancingTypeRawTipo de evento de reequilibrio
RebalancingDurationRawDuración del reequilibrio (segundos)
RebalancingCopiesMovedRawLas copias de componentes de inferencia se movieron durante el reequilibrio
AZSkewDeltaRawDesequilibrio de distribución por zonas de disponibilidad
InstancesReleasedRawInstancias liberadas mediante el reequilibrio

Métricas del marco de inferencia (vLLM/SGLang)

MétricaTipoDescripción
InputTokensPerSecondAgregadoVelocidad de los tokens de entrada
OutputTokensPerSecondAgregadoVelocidad de los tokens de salida
TotalTPSAgregadoTokens totales por segundo
TPSUtilizationAgregadoPorcentaje de utilización de TPS
TTFTRawTiempo transcurrido hasta el primer token (histograma)
InterTokenLatencyRawLatencia entre tokens (histograma)
KVCacheUtilizationRawPorcentaje de uso de caché KV
QueueDepthRawSolicitudes en espera (cola)
BatchSizeRawSolicitudes en ejecución (durante el vuelo)
TPSPerInstanceAgregadoTPS agregados por instancia
ConcurrentReqsPerCopyRawSolicitudes durante el vuelo por copia
FirstChunkLatencyPerICRawTTFT por componente de inferencia
4XXErrorRatePerICAgregadoErrores de cliente por componente de inferencia
5XXErrorRatePerICAgregadoErrores de servidor por componente de inferencia
TTFTPerICRawTTFT filtrada por componente de inferencia
ITLPerICRawITL filtrada por componente de inferencia
InputTPSPerICAgregadoTPS de entrada por componente de inferencia
OutputTPSPerICAgregadoTPS de salida por componente de inferencia
KVCachePerICRawCaché KV por componente de inferencia
ModelErrorBreakdownAgregadoDesglose de errores por tipo
nota

TTFT y InterTokenLatency dependen del marco y solo son compatibles con vLLM y SGLang.

Métricas de GPU (DCGM)

Estas métricas se recopilan del exportador de Data Center GPU Manager (DCGM) de NVIDIA. Están disponibles en todos los puntos de conexión de la GPU independientemente del marco de inferencia.

MétricaTipoDescripción
DCGM_FI_DEV_GPU_UTILRawUso de la GPU (%)
DCGM_FI_DEV_MEM_COPY_UTILRawUtilización de la copia de memoria (%)
DCGM_FI_DEV_GPU_TEMPRawTemperatura de la GPU (°C)
DCGM_FI_DEV_MEMORY_TEMPRawTemperatura de la memoria (°C)
DCGM_FI_DEV_FB_FREERawMemoria de framebuffer disponible (bytes)
DCGM_FI_DEV_FB_USEDRawMemoria de framebuffer utilizada (bytes)
DCGM_FI_DEV_SM_ACTIVERawMultiprocesador de flujo activo (%)

Métricas de nodos (instancias)

Estas métricas se recopilan del exportador de nodos. Proporcionan visibilidad a nivel de instancia del uso de la CPU, la memoria y el disco.

MétricaTipoDescripción
node_cpu_seconds_totalRawTiempo de CPU por modo y núcleo (segundos)
node_memory_MemTotal_bytesRawMemoria total (bytes)
node_memory_MemAvailable_bytesRawMemoria disponible (bytes)
node_filesystem_size_bytesRawTamaño total del sistema de archivos (bytes)
node_filesystem_avail_bytesRawEspacio disponible del sistema de archivos (bytes)

Métricas de ubicación de alta disponibilidad y componentes de inferencia

MétricaTipoDescripción
ICCopyCountPerAZAgregadoCopias de componentes de inferencia por zona de disponibilidad
ICCopiesPerAZAgregadoCopias de componentes de inferencia por zona de disponibilidad (vista alternativa)
AZSkewScoreAgregadoPuntuación de desequilibrio de zonas de disponibilidad
AZBalanceScoreAgregadoEquilibro a nivel de punto de conexión
ICDensityPerAZAgregadoDensidad de componentes de inferencia por zona de disponibilidad
ICCopiesPerInstanceAgregadoCopias de componentes de inferencia por instancia
ICListPerInstanceAgregadoQué componentes de inferencia hay en qué instancia

Métricas de ciclo de vida y aprovisionamiento

MétricaTipoDescripción
ModelDownloadTimeRawTiempo para que se descarguen las instancias en Amazon S3
GPULoadTimeRawTiempo para que las ponderaciones pasen a la memoria de GPU
ContainerStartDurationRawInicio del contenedor hasta la comprobación de estado
ColdStartDurationRawDe extremo a extremo: desde la creación hasta la primera invocación

Las métricas solo están disponibles como métricas clásicas de CloudWatch

Las siguientes métricas solo están disponibles como métricas clásicas de CloudWatch (modelo de espacio de nombres y dimensiones) y requieren el enriquecimiento de OTel para que aparezcan como métricas de OpenTelemetry.

MétricaNotas
InvocationsPerICBloqueado para la emisión directa de OpenTelemetry
InvocationsPerCopyBlocked
ModelLatencyPerICBloqueado: utilice vllm:e2e_request_latency_seconds como alternativa de OTel
OverheadLatencyPerICBlocked
MidStreamErrorsPerICBloqueado (solo flujo bidireccional)