

# CloudWatch SageMaker AI Insights
<a name="SageMaker-Insights"></a>

Use o CloudWatch SageMaker AI Insights para monitorar e solucionar problemas de endpoints de inferência do SageMaker AI em grande escala. O painel exibe métricas e visualizações selecionadas em três visualizações — **Desempenho**, **Capacidade** e **Confiabilidade** — para que você possa identificar problemas rapidamente, otimizar a utilização de recursos e garantir alta disponibilidade em seus endpoints.

O SageMaker AI Insights é compatível com o monitoramento de vários tipos de endpoints (endpoints de modelo único e endpoints baseados em componentes de inferência (IC)) e estruturas de inferência (vLLM, SGLang, TensorRT‐LLM).

Para conferir os conceitos básicos do SageMaker AI Insights, consulte os tópicos a seguir.

**Tópicos**
+ [Conceitos básicos do CloudWatch SageMaker AI Insights](SageMaker-AI-Insights-Get-Started.md)
+ [Painel do SageMaker AI Insights](SageMaker-AI-Insights-Dashboard.md)
+ [Referência de métricas OpenTelemetry do SageMaker AI Insights](SageMaker-AI-Insights-Metrics.md)
+ [Solução de problemas do SageMaker AI Insights](SageMaker-AI-Insights-Troubleshooting.md)

## Capacidades gerais
<a name="SageMaker-AI-Insights-capabilities"></a>
+ **Coleta nativa do OpenTelemetry.** As métricas são coletadas através de um coletor OTel, que extrai os endpoints do Prometheus a partir de DCGM (métricas de GPU), exportadores de nós (CPU, memória, disco) e contêineres de estrutura de inferência (vLLM, SGLang).
+ **Rótulos dimensionais ricos.** Cada métrica inclui rótulos como `aws.sagemaker.endpoint.name`, `aws.sagemaker.inference_component.name`, `@resource.host.id`, `@resource.cloud.availability_zone` e `@resource.host.type`.
+ **Atribuição por GPU.** As métricas de GPU (DCGM) incluem atribuição por componente de inferência para instâncias multilocatárias.
+ **Métricas da estrutura de inferência.** Métricas nativas de vLLM e SGLang — tokens por segundo, tempo até o primeiro token (TTFT), latência entre tokens, utilização do cache KV, profundidade da fila, tamanho do lote — sem instrumentação personalizada.
+ **Suporte a consultas PromQL.** Consulte no CloudWatch, no CloudWatch Query Studio ou no Amazon Managed Grafana.
+ **Frequência de coleta configurável.** Definir por meio de `MetricPublishFrequencyInSeconds` (10, 30, 60, 120, 180, 240 ou 300 segundos; padrão 60). As métricas do ambiente de gerenciamento são orientadas por eventos.

## Arquitetura e fluxo de dados
<a name="SageMaker-AI-Insights-architecture"></a>

1. O **contêiner do modelo**, o **exportador DCGM** e o **exportador de nós** expõem métricas compatíveis com o Prometheus na instância.

1. O **OTel Collector** coleta esses endpoints e enriquece cada métrica com rótulos (nome do endpoint, nome do IC, ID da instância, AZ).

1. Métricas enriquecidas são **exportadas via OTLP** para o CloudWatch.

1. As métricas podem ser **consultadas via PromQL** no CloudWatch.

```
┌─────────────────────────────────────────────────────────────────┐
│  SageMaker Endpoint Instance                                      │
│                                                                   │
│  ┌──────────────┐  ┌──────────────┐  ┌──────────────────────┐    │
│  │ Model        │  │ DCGM         │  │ Node Exporter        │    │
│  │ Container    │  │ Exporter     │  │ (CPU/Mem/Disk)       │    │
│  │ (vLLM/SGLang)│  │ (GPU)        │  │                      │    │
│  └──────┬───────┘  └──────┬───────┘  └──────────┬───────────┘    │
│         │                 │                     │                 │
│         └─────────────────┼─────────────────────┘                 │
│                           ▼                                       │
│              ┌─────────────────────────┐                          │
│              │   OTel Collector        │                          │
│              │   (scrape + enrich)     │                          │
│              └────────────┬────────────┘                          │
└───────────────────────────┼───────────────────────────────────────┘
                            │ OTLP
                            ▼
              ┌─────────────────────────┐
              │   Amazon CloudWatch     │
              │   (PromQL-queryable)    │
              └─────────────────────────┘
```

## Como acessar
<a name="SageMaker-AI-Insights-access"></a>

Você pode abrir o SageMaker AI Insights a partir do console do SageMaker AI usando qualquer um dos seguintes caminhos.


| Origem | Ação | Destino | 
| --- | --- | --- | 
| Console do SageMaker AI → Lista de endpoints | Escolha o Open SageMaker AI Insights | Painel em nível de frota (sem filtro) | 
| Console do SageMaker AI → página de detalhes do endpoint | Escolha Exibir no SageMaker AI Insights | Painel filtrado para esse endpoint | 
| Console do SageMaker AI → guia IC → Por linha IC | Escolha Métricas | Painel filtrado para endpoint e componente de inferência | 

Você também pode navegar diretamente pelo console do CloudWatch escolhendo **Monitoramento de infraestrutura** → **SageMaker AI Insights**.

## Pré-requisitos
<a name="SageMaker-AI-Insights-prerequisites"></a>
+ Ao menos um endpoint de inferência do SageMaker AI no status `InService`
+ `EnableDetailedObservability` definido como `true` na configuração do endpoint (padrão para novos endpoints)
+ Enriquecimento do OTel habilitado na sua conta
+ As permissões `cloudwatch:GetMetricData` e `cloudwatch:ListMetrics` do IAM

Para obter mais informações, consulte [Conceitos básicos do CloudWatch SageMaker AI Insights](SageMaker-AI-Insights-Get-Started.md).

## Preços
<a name="SageMaker-AI-Insights-pricing"></a>

A ingestão de métricas do CloudWatch OpenTelemetry se aplica. Para obter mais informações, consulte [Preços do Amazon CloudWatch](https://aws.amazon.com/cloudwatch/pricing/).