Referência de métricas OpenTelemetry do SageMaker AI Insights
Esta seção fornece uma lista abrangente das métricas OpenTelemetry emitidas pela observabilidade detalhada do SageMaker AI. A observabilidade detalhada é baseada no OpenTelemetry (OTel) e coleta métricas operacionais refinadas das camadas da GPU, do nó e da estrutura de inferência, publicando-as no CloudWatch com rótulos avançados.
A observabilidade detalhada publica métricas OpenTelemetry (OTel) no CloudWatch via OTLP. Essas não são métricas do Prometheus. As métricas são armazenadas nativamente no CloudWatch como dados de métricas do OTel e podem ser consultadas usando a sintaxe do PromQL.
Métricas agregadas no nível da conta
| Métrica | Tipo | Descrição |
TotalEndpoints | Agregar | Contagem de todos os endpoints na conta |
TotalICs | Agregar | Contagem de todos os componentes de inferência |
TotalGPUs | Agregar | Contagem de todas as GPUs (derivada de DCGM_FI_DEV_GPU_UTIL) |
Métricas em nível de endpoint
| Métrica | Tipo | Descrição |
InstanceCountPerEndpoint | Agregar | Contagem de instâncias que atendem ao tráfego |
InstancesPerAZ | Agregar | Instâncias por zona de disponibilidade |
EmptyInstanceCount | Agregar | Instâncias sem ICs colocados |
ScalingAction | Bruto | Evento de escalabilidade (entrada/saída) |
ICECount | Bruto | Contagem de erro de capacidade insuficiente |
CPUUtilization (EP) | Agregar | Utilização da CPU em nível de endpoint |
MemoryUtilization (EP) | Agregar | Utilização da memória em nível de endpoint |
DiskUtilization (EP) | Agregar | Utilização de disco em nível de endpoint |
E2EScalingLatency | Bruto | Duração do escalonamento de ponta a ponta |
RebalancingType | Bruto | Tipo de evento de rebalanceamento |
RebalancingDuration | Bruto | Duração do rebalanceamento (segundos) |
RebalancingCopiesMoved | Bruto | Cópias de IC movidas durante o rebalanceamento |
AZSkewDelta | Bruto | Desequilíbrio na distribuição de AZ |
InstancesReleased | Bruto | Instâncias liberadas pelo rebalanceamento |
Métricas da estrutura de inferência (vLLM / SGLang)
| Métrica | Tipo | Descrição |
InputTokensPerSecond | Agregar | Taxa de tokens de entrada |
OutputTokensPerSecond | Agregar | Taxa de tokens de saída |
TotalTPS | Agregar | Tokens totais por segundo |
TPSUtilization | Agregar | Porcentagem de utilização de TPS |
TTFT | Bruto | Tempo até o primeiro token (histograma) |
InterTokenLatency | Bruto | Latência entre tokens (histograma) |
KVCacheUtilization | Bruto | Porcentagem de uso do cache de KV |
QueueDepth | Bruto | Solicitações em espera (fila) |
BatchSize | Bruto | Solicitações em execução (em andamento) |
TPSPerInstance | Agregar | TPS agregado por instância |
ConcurrentReqsPerCopy | Bruto | Solicitações em andamento por cópia |
FirstChunkLatencyPerIC | Bruto | TTFT por IC |
4XXErrorRatePerIC | Agregar | Erros do cliente por IC |
5XXErrorRatePerIC | Agregar | Erros de servidor por IC |
TTFTPerIC | Bruto | TTFT filtrado por IC |
ITLPerIC | Bruto | ITL filtrado por IC |
InputTPSPerIC | Agregar | TPS de entrada por IC |
OutputTPSPerIC | Agregar | TPS de saída por IC |
KVCachePerIC | Bruto | Cache de KV por IC |
ModelErrorBreakdown | Agregar | Detalhamento do erro por tipo |
TTFT e InterTokenLatency dependem da estrutura e são compatíveis apenas com vLLM e SGLang.
Métricas de GPU (DCGM)
Essas métricas são coletadas do exportador do NVIDIA Data Center GPU Manager (DCGM). Elas estão disponíveis em todos os endpoints da GPU, independentemente da estrutura de inferência.
| Métrica | Tipo | Descrição |
DCGM_FI_DEV_GPU_UTIL | Bruto | Utilização da GPU (%) |
DCGM_FI_DEV_MEM_COPY_UTIL | Bruto | Utilização da cópia da memória (%) |
DCGM_FI_DEV_GPU_TEMP | Bruto | Temperatura da GPU (°C) |
DCGM_FI_DEV_MEMORY_TEMP | Bruto | Temperatura da memória (°C) |
DCGM_FI_DEV_FB_FREE | Bruto | Memória livre do framebuffer (bytes) |
DCGM_FI_DEV_FB_USED | Bruto | Memória usada do famebuffer (bytes) |
DCGM_FI_DEV_SM_ACTIVE | Bruto | Multiprocessador de transmissão ativo (%) |
Métricas de nó (instância)
Essas métricas são coletadas do exportador de nós. Elas fornecem visibilidade em nível de instância da utilização da CPU, da memória e do disco.
| Métrica | Tipo | Descrição |
node_cpu_seconds_total | Bruto | Tempo de CPU por modo por núcleo (segundos) |
node_memory_MemTotal_bytes | Bruto | Memória total (bytes) |
node_memory_MemAvailable_bytes | Bruto | Memória disponível (bytes) |
node_filesystem_size_bytes | Bruto | Tamanho total do sistema de arquivos (bytes) |
node_filesystem_avail_bytes | Bruto | Espaço disponível no sistema de arquivos (bytes) |
Métricas de posicionamento de HA e IC
| Métrica | Tipo | Descrição |
ICCopyCountPerAZ | Agregar | Cópias de IC por AZ |
ICCopiesPerAZ | Agregar | Cópias de IC por AZ (visão alternativa) |
AZSkewScore | Agregar | Pontuação de desequilíbrio de AZ |
AZBalanceScore | Agregar | Equilíbrio em nível de endpoint |
ICDensityPerAZ | Agregar | Densidade de IC por AZ |
ICCopiesPerInstance | Agregar | Cópias de IC por instância |
ICListPerInstance | Agregar | Quais ICs em qual instância |
Métricas de ciclo de vida e provisionamento
| Métrica | Tipo | Descrição |
ModelDownloadTime | Bruto | Tempo para o Amazon S3 baixar a instância |
GPULoadTime | Bruto | Tempo para carregar os pesos na memória da GPU |
ContainerStartDuration | Bruto | Início da verificação de integridade do contêiner |
ColdStartDuration | Bruto | De ponta a ponta: da criação à primeira invocação |
Métricas disponíveis somente como métricas Classic do CloudWatch
As métricas a seguir estão disponíveis somente como métricas Classic do CloudWatch (namespace e modelo de dimensão) e exigem que o enriquecimento do OTel apareça como métricas do OpenTelemetry.
| Métrica | Observações |
InvocationsPerIC | Bloqueado contra emissão direta do OpenTelemetry |
InvocationsPerCopy | Bloqueado |
ModelLatencyPerIC | Bloqueado: use vllm:e2e_request_latency_seconds como alternativa ao OTel |
OverheadLatencyPerIC | Bloqueado |
MidStreamErrorsPerIC | Bloqueado (somente transmissão bidirecional) |