Panel de Información de SageMaker AI
El panel de Información de Sagemaker AI se organiza en tres pestañas: Rendimiento, Capacidad y Fiabilidad. Cada pestaña proporciona una vista detallada del estado de los puntos de conexión de inferencia.
Diseño del panel
Barra de resumen
La barra de resumen en la parte superior del panel muestra los totales de toda la flota.
| Métrica | Descripción |
|---|---|
| Invocations | Número total de invocaciones en todos los puntos de conexión del intervalo de tiempo seleccionado |
| instancias | Número total de instancias que actualmente atienden el tráfico |
| Componentes de inferencias | Número total de componentes de inferencia en todos los puntos de conexión |
| Sesgo promedio de las zonas de disponibilidad | Desequilibrio promedio en la distribución de las zonas de disponibilidad (0 % = equilibrio perfecto) |
Panel de filtros
| Filtro | Descripción |
|---|---|
| Punto de conexión | Seleccione un punto de conexión específico o Todos los puntos de conexión para ver la flota |
| Instancia | Seleccione una instancia específica (primero debe seleccionar un punto de conexión) |
| Componente de inferencia | Seleccione un componente de inferencia específico para filtrarlo en detalle |
Desglosar
Información de Sagemaker AI admite el desglose progresivo.
Nivel de flota (predeterminado): todos los puntos de conexión están visibles y las métricas resumidas se agregan
Nivel de punto de conexión: seleccione un punto de conexión del panel de filtros o elija un enlace de punto de conexión en cualquier tabla
Nivel de componente de inferencia: seleccione un componente de inferencia en el panel de filtros
Enlaces cruzados con la consola de SageMaker AI
Seleccione un nombre de punto de conexión para abrir la página de detalles del punto de conexión en la consola de SageMaker AI.
Seleccione Ver registros para abrir Registros de CloudWatch con filtros en ese punto de conexión o componente de inferencia.
En la consola de SageMaker AI, seleccione Ver en Información de SageMaker AI o Métricas para ver una fila por componente de inferencia.
Acceso al panel
Puede acceder al panel de Información de SageMaker AI desde varias ubicaciones de la consola.
-
Desde la página con la lista de puntos de conexión: seleccione Ver en Información de SageMaker AI para abrir el panel a nivel de flota sin aplicar filtros.
-
Desde la página de detalles de los puntos de conexión: seleccione Ver en Información de SageMaker AI para abrir el panel filtrado a ese punto de conexión.
-
Desde la página de detalles de los componentes de inferencia: seleccione Ver en Información de SageMaker AI para abrir el panel filtrado a ese punto de conexión y componente de inferencia.
Navegación directa: consola de CloudWatch → Supervisión de infraestructuras → Información de SageMaker AI.
Pestaña “Rendimiento”
La pestaña Rendimiento responde a las preguntas “¿está en buen estado?” y “¿por qué va lento?”, que van desde el estado de toda la flota, en la parte superior, hasta los diagnósticos de cada componente de inferencia, en la parte inferior.
- Estado del rendimiento
-
Panales agrupados por zona de disponibilidad que muestran el estado de alarma de las instancias, las copias de los componentes de inferencia y los puntos de conexión de un vistazo.
- Tabla de rendimiento de instancias
-
Desglose por instancia que muestra la TTFT (P50/P99), el TPS de salida (promedio/máximo), las solicitudes simultáneas (activo/máximo) y el uso de la caché KV.
- Transmisión de tokens
-
Gráfico de series temporales que muestra la TTFT y la latencia entre tokens (ITL) con un conmutador P50/P99, desglosadas por marco.
- Rendimiento de tokens
-
Tokens de entrada y salida por segundo por marco, con opciones para las vistas de entrada y salida, percentiles y para cada instancia.
- Presión del motor y de las solicitudes
-
Utilización de la caché KV (%), solicitudes en ejecución y solicitudes en espera a lo largo del tiempo: señales de saturación clave para el motor de inferencia.
- Distribución de tráfico
-
Tabla por instancia o por copia de componente de inferencia que muestra las invocaciones por minuto, la tasa de errores 4XX y la tasa de errores 5XX para identificar los desequilibrios de enrutamiento.
- Combinación de errores a lo largo del tiempo
-
Gráfico de líneas que muestra las tasas de errores 4XX, 5XX y durante el proceso a lo largo del tiempo por componente de inferencia.
- Desglose de la latencia a lo largo del tiempo
-
Gráfico de áreas apiladas con pestañas para la invocación (latencia del modelo + latencia de sobrecarga) y la transmisión (modelo del primer fragmento + sobrecarga del primer fragmento), con un conmutador para P50/P90.
Pestaña “Capacidad”
La pestaña Capacidad responde a las preguntas “¿tengo espacio libre?” y “¿mi hardware está en buen estado?” y muestra la utilización real en comparación con la capacidad reservada.
- Estado de la capacidad
-
La misma visualización en forma de panal que aparece en la pestaña Rendimiento, que muestra el estado de alarma de las instancias, las copias de componentes de inferencia y los puntos de conexión.
- Tabla de capacidad de instancias
-
Barras de uso por instancias para GPU, memoria de GPU, CPU, memoria y disco.
- Utilización de la flota
-
Serie temporal que muestra el uso de la CPU, la GPU, la memoria de la GPU, la memoria y el disco por instancia, con opciones para ver la instancia, las copias de componentes de inferencia y el punto de conexión.
Pestaña “Fiabilidad”
La pestaña Fiabilidad responde a las preguntas “¿es resiliente?” y “¿por qué se produjo un error en el escalado?” y abarca la distribución en zonas de disponibilidad, el comportamiento de escalado y los eventos de aprovisionamiento.
- Distribución de zonas de disponibilidad
-
Gráfico de barras que muestra el número de copias de instancias o componentes de inferencia por zona de disponibilidad para validar el cumplimiento de la alta disponibilidad (HA).
- Anatomía de arranque en frío
-
Barra horizontal apilada que muestra el desglose del tiempo de aprovisionamiento en descarga del modelo, carga de la GPU, inicio del contenedor y sobrecarga de la plataforma (solo puntos de conexión de los componentes de inferencia).
- Diagnóstico de errores ICE
-
Recuento de errores de capacidad insuficiente (ICE) a lo largo del tiempo con una tabla de eventos que muestra la hora, el punto de conexión, el tipo de instancia con error y la zona de disponibilidad con error. Los valores distintos de cero indican restricciones de capacidad.