

# CloudWatch SageMaker AI Insights
<a name="SageMaker-Insights"></a>

Use CloudWatch SageMaker AI Insights para supervisar y solucionar los problemas de los puntos de conexión de inferencia de SageMaker AI a escala. El panel muestra métricas y visualizaciones seleccionadas en tres visualizaciones (**Rendimiento**, **Capacidad** y **Fiabilidad**) para que pueda identificar rápidamente los problemas, optimizar el uso de recursos y garantizar una alta disponibilidad en todos los puntos de conexión.

Sagemaker AI Insights admite la supervisión de todos los tipos de puntos de conexión (puntos de conexión de modelo único y puntos de conexión basados en componentes de inferencia [IC]) y marcos de inferencia (vLLM, SGLang, TensorRT‐LLM).

Para comenzar a usar SageMaker AI Insights, consulte los temas siguientes.

**Temas**
+ [Introducción a Información de SageMaker AI de CloudWatch](SageMaker-AI-Insights-Get-Started.md)
+ [Panel de Información de SageMaker AI](SageMaker-AI-Insights-Dashboard.md)
+ [Referencia de métricas de OpenTelemetry de Información de SageMaker AI](SageMaker-AI-Insights-Metrics.md)
+ [Solución de problemas de Información de SageMaker AI](SageMaker-AI-Insights-Troubleshooting.md)

## Capacidades clave
<a name="SageMaker-AI-Insights-capabilities"></a>
+ **Colección nativa de OpenTelemetry.** Las métricas se recopilan mediante un recopilador de OTel que raspa los puntos de conexión de Prometheus de la DCGM (métricas de GPU), los exportadores de nodos (CPU, memoria, disco) y los contenedores de marcos de inferencia (vLLM, SGLang).
+ **Etiquetas dimensionales enriquecidas.** Cada métrica incluye etiquetas como `aws.sagemaker.endpoint.name`, `aws.sagemaker.inference_component.name`, `@resource.host.id`, `@resource.cloud.availability_zone` y `@resource.host.type`.
+ **Atribución por GPU.** Las métricas de GPU (DCGM) incluyen la atribución por componente de inferencia para las instancias de varios inquilinos.
+ **Métricas de marcos de inferencia.** Métricas nativas de vLLM y SGLang (tokens por segundo, tiempo transcurrido hasta el primer token [TTFT], latencia entre tokens, uso de la caché de KV, profundidad de cola, tamaño de lote), sin instrumentación personalizada.
+ **Compatibilidad de consultas de PromQL.** Consulte en CloudWatch, CloudWatch Query Studio o Amazon Managed Grafana.
+ **Frecuencia de raspado configurable.** Configure a través de `MetricPublishFrequencyInSeconds` (10, 30, 60, 120, 180, 240 o 300 segundos; 60 por defecto). Las métricas del plano de control se basan en eventos.

## Arquitectura y flujo de datos
<a name="SageMaker-AI-Insights-architecture"></a>

1. El **contenedor de modelos**, el **exportador de DCGM** y el **exportador de nodos** muestran métricas compatibles con Prometheus en la instancia.

1. El **recopilador de OTel** raspa estos puntos de conexión y enriquece cada métrica con etiquetas (nombre de punto de conexión, nombre de IC, ID de instancia, AZ).

1. Las métricas enriquecidas se **exportan mediante OTLP** a CloudWatch.

1. Las métricas se pueden **consultar mediante PromQL** en CloudWatch.

```
┌─────────────────────────────────────────────────────────────────┐
│  SageMaker Endpoint Instance                                      │
│                                                                   │
│  ┌──────────────┐  ┌──────────────┐  ┌──────────────────────┐    │
│  │ Model        │  │ DCGM         │  │ Node Exporter        │    │
│  │ Container    │  │ Exporter     │  │ (CPU/Mem/Disk)       │    │
│  │ (vLLM/SGLang)│  │ (GPU)        │  │                      │    │
│  └──────┬───────┘  └──────┬───────┘  └──────────┬───────────┘    │
│         │                 │                     │                 │
│         └─────────────────┼─────────────────────┘                 │
│                           ▼                                       │
│              ┌─────────────────────────┐                          │
│              │   OTel Collector        │                          │
│              │   (scrape + enrich)     │                          │
│              └────────────┬────────────┘                          │
└───────────────────────────┼───────────────────────────────────────┘
                            │ OTLP
                            ▼
              ┌─────────────────────────┐
              │   Amazon CloudWatch     │
              │   (PromQL-queryable)    │
              └─────────────────────────┘
```

## Cómo acceder
<a name="SageMaker-AI-Insights-access"></a>

Puede abrir SageMaker AI Insights desde la consola de SageMaker AI mediante cualquiera de las siguientes rutas.


| Origen | Action | Destino | 
| --- | --- | --- | 
| Consola de SageMaker AI → Lista Puntos de conexión | Elija Abrir SageMaker AI Insights | Panel de flotas (sin filtro) | 
| Consola de SageMaker AI → página de detalles del punto de conexión | Elija Ver en SageMaker AI Insights | Panel filtrado a ese punto de conexión | 
| Consola de SageMaker AI → Pestaña IC → fila por IC | Elija Métricas | Panel filtrado al punto de conexión y el componente de inferencia | 

Para navegar directamente a través de la consola de CloudWatch, elija **Supervisión de la infraestructura** → **SageMaker AI Insights**.

## Requisitos previos
<a name="SageMaker-AI-Insights-prerequisites"></a>
+ Al menos un punto de conexión de inferencia de SageMaker AI con el estado `InService`
+ `EnableDetailedObservability` establecido en `true` en la configuración de punto de conexión (valor predeterminado para los puntos de conexión nuevos)
+ Enriquecimiento de OTel habilitado en la cuenta
+ Permisos de IAM `cloudwatch:GetMetricData` y `cloudwatch:ListMetrics`

Para obtener más información, consulte [Introducción a Información de SageMaker AI de CloudWatch](SageMaker-AI-Insights-Get-Started.md).

## Precios
<a name="SageMaker-AI-Insights-pricing"></a>

Se aplica la ingesta de métricas de OpenTelemetry de CloudWatch. Para obtener más información, consulte [Precios de Amazon CloudWatch](https://aws.amazon.com/cloudwatch/pricing/).