View a markdown version of this page

Referência de métricas OpenTelemetry do SageMaker AI Insights - Amazon CloudWatch

Referência de métricas OpenTelemetry do SageMaker AI Insights

Esta seção fornece uma lista abrangente das métricas OpenTelemetry emitidas pela observabilidade detalhada do SageMaker AI. A observabilidade detalhada é baseada no OpenTelemetry (OTel) e coleta métricas operacionais refinadas das camadas da GPU, do nó e da estrutura de inferência, publicando-as no CloudWatch com rótulos avançados.

nota

A observabilidade detalhada publica métricas OpenTelemetry (OTel) no CloudWatch via OTLP. Essas não são métricas do Prometheus. As métricas são armazenadas nativamente no CloudWatch como dados de métricas do OTel e podem ser consultadas usando a sintaxe do PromQL.

Métricas agregadas no nível da conta

MétricaTipoDescrição
TotalEndpointsAgregarContagem de todos os endpoints na conta
TotalICsAgregarContagem de todos os componentes de inferência
TotalGPUsAgregarContagem de todas as GPUs (derivada de DCGM_FI_DEV_GPU_UTIL)

Métricas em nível de endpoint

MétricaTipoDescrição
InstanceCountPerEndpointAgregarContagem de instâncias que atendem ao tráfego
InstancesPerAZAgregarInstâncias por zona de disponibilidade
EmptyInstanceCountAgregarInstâncias sem ICs colocados
ScalingActionBrutoEvento de escalabilidade (entrada/saída)
ICECountBrutoContagem de erro de capacidade insuficiente
CPUUtilization (EP)AgregarUtilização da CPU em nível de endpoint
MemoryUtilization (EP)AgregarUtilização da memória em nível de endpoint
DiskUtilization (EP)AgregarUtilização de disco em nível de endpoint
E2EScalingLatencyBrutoDuração do escalonamento de ponta a ponta
RebalancingTypeBrutoTipo de evento de rebalanceamento
RebalancingDurationBrutoDuração do rebalanceamento (segundos)
RebalancingCopiesMovedBrutoCópias de IC movidas durante o rebalanceamento
AZSkewDeltaBrutoDesequilíbrio na distribuição de AZ
InstancesReleasedBrutoInstâncias liberadas pelo rebalanceamento

Métricas da estrutura de inferência (vLLM / SGLang)

MétricaTipoDescrição
InputTokensPerSecondAgregarTaxa de tokens de entrada
OutputTokensPerSecondAgregarTaxa de tokens de saída
TotalTPSAgregarTokens totais por segundo
TPSUtilizationAgregarPorcentagem de utilização de TPS
TTFTBrutoTempo até o primeiro token (histograma)
InterTokenLatencyBrutoLatência entre tokens (histograma)
KVCacheUtilizationBrutoPorcentagem de uso do cache de KV
QueueDepthBrutoSolicitações em espera (fila)
BatchSizeBrutoSolicitações em execução (em andamento)
TPSPerInstanceAgregarTPS agregado por instância
ConcurrentReqsPerCopyBrutoSolicitações em andamento por cópia
FirstChunkLatencyPerICBrutoTTFT por IC
4XXErrorRatePerICAgregarErros do cliente por IC
5XXErrorRatePerICAgregarErros de servidor por IC
TTFTPerICBrutoTTFT filtrado por IC
ITLPerICBrutoITL filtrado por IC
InputTPSPerICAgregarTPS de entrada por IC
OutputTPSPerICAgregarTPS de saída por IC
KVCachePerICBrutoCache de KV por IC
ModelErrorBreakdownAgregarDetalhamento do erro por tipo
nota

TTFT e InterTokenLatency dependem da estrutura e são compatíveis apenas com vLLM e SGLang.

Métricas de GPU (DCGM)

Essas métricas são coletadas do exportador do NVIDIA Data Center GPU Manager (DCGM). Elas estão disponíveis em todos os endpoints da GPU, independentemente da estrutura de inferência.

MétricaTipoDescrição
DCGM_FI_DEV_GPU_UTILBrutoUtilização da GPU (%)
DCGM_FI_DEV_MEM_COPY_UTILBrutoUtilização da cópia da memória (%)
DCGM_FI_DEV_GPU_TEMPBrutoTemperatura da GPU (°C)
DCGM_FI_DEV_MEMORY_TEMPBrutoTemperatura da memória (°C)
DCGM_FI_DEV_FB_FREEBrutoMemória livre do framebuffer (bytes)
DCGM_FI_DEV_FB_USEDBrutoMemória usada do famebuffer (bytes)
DCGM_FI_DEV_SM_ACTIVEBrutoMultiprocessador de transmissão ativo (%)

Métricas de nó (instância)

Essas métricas são coletadas do exportador de nós. Elas fornecem visibilidade em nível de instância da utilização da CPU, da memória e do disco.

MétricaTipoDescrição
node_cpu_seconds_totalBrutoTempo de CPU por modo por núcleo (segundos)
node_memory_MemTotal_bytesBrutoMemória total (bytes)
node_memory_MemAvailable_bytesBrutoMemória disponível (bytes)
node_filesystem_size_bytesBrutoTamanho total do sistema de arquivos (bytes)
node_filesystem_avail_bytesBrutoEspaço disponível no sistema de arquivos (bytes)

Métricas de posicionamento de HA e IC

MétricaTipoDescrição
ICCopyCountPerAZAgregarCópias de IC por AZ
ICCopiesPerAZAgregarCópias de IC por AZ (visão alternativa)
AZSkewScoreAgregarPontuação de desequilíbrio de AZ
AZBalanceScoreAgregarEquilíbrio em nível de endpoint
ICDensityPerAZAgregarDensidade de IC por AZ
ICCopiesPerInstanceAgregarCópias de IC por instância
ICListPerInstanceAgregarQuais ICs em qual instância

Métricas de ciclo de vida e provisionamento

MétricaTipoDescrição
ModelDownloadTimeBrutoTempo para o Amazon S3 baixar a instância
GPULoadTimeBrutoTempo para carregar os pesos na memória da GPU
ContainerStartDurationBrutoInício da verificação de integridade do contêiner
ColdStartDurationBrutoDe ponta a ponta: da criação à primeira invocação

Métricas disponíveis somente como métricas Classic do CloudWatch

As métricas a seguir estão disponíveis somente como métricas Classic do CloudWatch (namespace e modelo de dimensão) e exigem que o enriquecimento do OTel apareça como métricas do OpenTelemetry.

MétricaObservações
InvocationsPerICBloqueado contra emissão direta do OpenTelemetry
InvocationsPerCopyBloqueado
ModelLatencyPerICBloqueado: use vllm:e2e_request_latency_seconds como alternativa ao OTel
OverheadLatencyPerICBloqueado
MidStreamErrorsPerICBloqueado (somente transmissão bidirecional)