

# Referência de métricas OpenTelemetry do SageMaker AI Insights
<a name="SageMaker-AI-Insights-Metrics"></a>

Esta seção fornece uma lista abrangente das métricas OpenTelemetry emitidas pela observabilidade detalhada do SageMaker AI. A observabilidade detalhada é baseada no OpenTelemetry (OTel) e coleta métricas operacionais refinadas das camadas da GPU, do nó e da estrutura de inferência, publicando-as no CloudWatch com rótulos avançados.

**nota**  
A observabilidade detalhada publica métricas OpenTelemetry (OTel) no CloudWatch via OTLP. Essas não são métricas do Prometheus. As métricas são armazenadas nativamente no CloudWatch como dados de métricas do OTel e podem ser consultadas usando a sintaxe do PromQL.

## Métricas agregadas no nível da conta
<a name="SageMaker-AI-Insights-Metrics-account"></a>


| Métrica | Tipo | Descrição | 
| --- | --- | --- | 
| TotalEndpoints | Agregar | Contagem de todos os endpoints na conta | 
| TotalICs | Agregar | Contagem de todos os componentes de inferência | 
| TotalGPUs | Agregar | Contagem de todas as GPUs (derivada de DCGM\_FI\_DEV\_GPU\_UTIL) | 

## Métricas em nível de endpoint
<a name="SageMaker-AI-Insights-Metrics-endpoint"></a>


| Métrica | Tipo | Descrição | 
| --- | --- | --- | 
| InstanceCountPerEndpoint | Agregar | Contagem de instâncias que atendem ao tráfego | 
| InstancesPerAZ | Agregar | Instâncias por zona de disponibilidade | 
| EmptyInstanceCount | Agregar | Instâncias sem ICs colocados | 
| ScalingAction | Bruto | Evento de escalabilidade (entrada/saída) | 
| ICECount | Bruto | Contagem de erro de capacidade insuficiente | 
| CPUUtilization (EP) | Agregar | Utilização da CPU em nível de endpoint | 
| MemoryUtilization (EP) | Agregar | Utilização da memória em nível de endpoint | 
| DiskUtilization (EP) | Agregar | Utilização de disco em nível de endpoint | 
| E2EScalingLatency | Bruto | Duração do escalonamento de ponta a ponta | 
| RebalancingType | Bruto | Tipo de evento de rebalanceamento | 
| RebalancingDuration | Bruto | Duração do rebalanceamento (segundos) | 
| RebalancingCopiesMoved | Bruto | Cópias de IC movidas durante o rebalanceamento | 
| AZSkewDelta | Bruto | Desequilíbrio na distribuição de AZ | 
| InstancesReleased | Bruto | Instâncias liberadas pelo rebalanceamento | 

## Métricas da estrutura de inferência (vLLM / SGLang)
<a name="SageMaker-AI-Insights-Metrics-framework"></a>


| Métrica | Tipo | Descrição | 
| --- | --- | --- | 
| InputTokensPerSecond | Agregar | Taxa de tokens de entrada | 
| OutputTokensPerSecond | Agregar | Taxa de tokens de saída | 
| TotalTPS | Agregar | Tokens totais por segundo | 
| TPSUtilization | Agregar | Porcentagem de utilização de TPS | 
| TTFT | Bruto | Tempo até o primeiro token (histograma) | 
| InterTokenLatency | Bruto | Latência entre tokens (histograma) | 
| KVCacheUtilization | Bruto | Porcentagem de uso do cache de KV | 
| QueueDepth | Bruto | Solicitações em espera (fila) | 
| BatchSize | Bruto | Solicitações em execução (em andamento) | 
| TPSPerInstance | Agregar | TPS agregado por instância | 
| ConcurrentReqsPerCopy | Bruto | Solicitações em andamento por cópia | 
| FirstChunkLatencyPerIC | Bruto | TTFT por IC | 
| 4XXErrorRatePerIC | Agregar | Erros do cliente por IC | 
| 5XXErrorRatePerIC | Agregar | Erros de servidor por IC | 
| TTFTPerIC | Bruto | TTFT filtrado por IC | 
| ITLPerIC | Bruto | ITL filtrado por IC | 
| InputTPSPerIC | Agregar | TPS de entrada por IC | 
| OutputTPSPerIC | Agregar | TPS de saída por IC | 
| KVCachePerIC | Bruto | Cache de KV por IC | 
| ModelErrorBreakdown | Agregar | Detalhamento do erro por tipo | 

**nota**  
`TTFT` e `InterTokenLatency` dependem da estrutura e são compatíveis apenas com vLLM e SGLang.

## Métricas de GPU (DCGM)
<a name="SageMaker-AI-Insights-Metrics-gpu"></a>

Essas métricas são coletadas do exportador do NVIDIA Data Center GPU Manager (DCGM). Elas estão disponíveis em todos os endpoints da GPU, independentemente da estrutura de inferência.


| Métrica | Tipo | Descrição | 
| --- | --- | --- | 
| DCGM\_FI\_DEV\_GPU\_UTIL | Bruto | Utilização da GPU (%) | 
| DCGM\_FI\_DEV\_MEM\_COPY\_UTIL | Bruto | Utilização da cópia da memória (%) | 
| DCGM\_FI\_DEV\_GPU\_TEMP | Bruto | Temperatura da GPU (°C) | 
| DCGM\_FI\_DEV\_MEMORY\_TEMP | Bruto | Temperatura da memória (°C) | 
| DCGM\_FI\_DEV\_FB\_FREE | Bruto | Memória livre do framebuffer (bytes) | 
| DCGM\_FI\_DEV\_FB\_USED | Bruto | Memória usada do famebuffer (bytes) | 
| DCGM\_FI\_DEV\_SM\_ACTIVE | Bruto | Multiprocessador de transmissão ativo (%) | 

## Métricas de nó (instância)
<a name="SageMaker-AI-Insights-Metrics-node"></a>

Essas métricas são coletadas do exportador de nós. Elas fornecem visibilidade em nível de instância da utilização da CPU, da memória e do disco.


| Métrica | Tipo | Descrição | 
| --- | --- | --- | 
| node\_cpu\_seconds\_total | Bruto | Tempo de CPU por modo por núcleo (segundos) | 
| node\_memory\_MemTotal\_bytes | Bruto | Memória total (bytes) | 
| node\_memory\_MemAvailable\_bytes | Bruto | Memória disponível (bytes) | 
| node\_filesystem\_size\_bytes | Bruto | Tamanho total do sistema de arquivos (bytes) | 
| node\_filesystem\_avail\_bytes | Bruto | Espaço disponível no sistema de arquivos (bytes) | 

## Métricas de posicionamento de HA e IC
<a name="SageMaker-AI-Insights-Metrics-ha"></a>


| Métrica | Tipo | Descrição | 
| --- | --- | --- | 
| ICCopyCountPerAZ | Agregar | Cópias de IC por AZ | 
| ICCopiesPerAZ | Agregar | Cópias de IC por AZ (visão alternativa) | 
| AZSkewScore | Agregar | Pontuação de desequilíbrio de AZ | 
| AZBalanceScore | Agregar | Equilíbrio em nível de endpoint | 
| ICDensityPerAZ | Agregar | Densidade de IC por AZ | 
| ICCopiesPerInstance | Agregar | Cópias de IC por instância | 
| ICListPerInstance | Agregar | Quais ICs em qual instância | 

## Métricas de ciclo de vida e provisionamento
<a name="SageMaker-AI-Insights-Metrics-lifecycle"></a>


| Métrica | Tipo | Descrição | 
| --- | --- | --- | 
| ModelDownloadTime | Bruto | Tempo para o Amazon S3 baixar a instância | 
| GPULoadTime | Bruto | Tempo para carregar os pesos na memória da GPU | 
| ContainerStartDuration | Bruto | Início da verificação de integridade do contêiner | 
| ColdStartDuration | Bruto | De ponta a ponta: da criação à primeira invocação | 

## Métricas disponíveis somente como métricas Classic do CloudWatch
<a name="SageMaker-AI-Insights-Metrics-classic"></a>

As métricas a seguir estão disponíveis somente como métricas Classic do CloudWatch (namespace e modelo de dimensão) e exigem que o enriquecimento do OTel apareça como métricas do OpenTelemetry.


| Métrica | Observações | 
| --- | --- | 
| InvocationsPerIC | Bloqueado contra emissão direta do OpenTelemetry | 
| InvocationsPerCopy | Bloqueado | 
| ModelLatencyPerIC | Bloqueado: use vllm:e2e\_request\_latency\_seconds como alternativa ao OTel | 
| OverheadLatencyPerIC | Bloqueado | 
| MidStreamErrorsPerIC | Bloqueado (somente transmissão bidirecional) | 