View a markdown version of this page

Painel do SageMaker AI Insights - Amazon CloudWatch

Painel do SageMaker AI Insights

O painel do SageMaker AI Insights é organizado em três guias: Desempenho, Capacidade e Confiabilidade. Cada guia fornece uma visão focada da integridade do seu endpoint de inferência.

Layout do painel

Barra de resumo

A barra de resumo na parte superior do painel mostra os totais de toda a frota.

Cabeçalho do painel do SageMaker AI Insights com barra de resumo mostrando invocações, instâncias, componentes de inferência e Avg AZ Skew.
MétricaDescrição
InvocationsTotal de invocações em todos os endpoints no intervalo de tempo selecionado
InstânciasNúmero total de instâncias que atendem ao tráfego
Componentes de inferênciaNúmero total de componentes de inferência em todos os endpoints
Avg AZ SkewDesequilíbrio médio na distribuição da zona de disponibilidade (0% = perfeitamente equilibrado)

Painel de filtros

FiltroDescrição
EndpointSelecione um endpoint específico ou Todos os endpoints para a visualização da frota
InstânciaSelecione uma instância específica (requer que um endpoint seja selecionado primeiro)
Componente de inferênciaSelecione um IC específico para filtragem granular

Detalhar

O SageMaker AI Insights é compatível com o detalhamento progressivo.

  1. Nível da frota (padrão): todos os endpoints visíveis, métricas resumidas agregadas

  2. Nível do endpoint: selecione um endpoint no painel de filtro ou escolha um link de endpoint em qualquer tabela

  3. Nível de IC: selecione um componente de inferência no painel de filtro

Vinculação cruzada com o console do SageMaker AI

  • Selecione um nome de endpoint para abrir a página de detalhes do endpoint no console do SageMaker AI.

  • Escolha Exibir logs para abrir os logs do CloudWatch Logs filtrados para esse endpoint ou IC.

  • No console do SageMaker AI, escolha Exibir no SageMaker AI Insights ou Métricas para uma linha por IC.

Acessar o painel

Você pode acessar o painel do SageMaker AI Insights de vários locais no console.

  • Na página da lista de endpoints: escolha Exibir no SageMaker AI Insights para abrir o painel no nível da frota sem a aplicação de filtros.

    Página de listagem de endpoints mostrando o botão Exibir no SageMaker AI Insights.
  • Na página de detalhes do endpoint: escolha Exibir no SageMaker AI Insights para abrir o painel filtrado para esse endpoint.

    Página de detalhes do endpoint mostrando o botão Exibir no SageMaker AI Insights.
  • Na página de detalhes do componente de inferência: escolha Exibir no SageMaker AI Insights para abrir o painel filtrado para esse endpoint e componente de inferência.

    Página de detalhes do componente de inferência mostrando o botão Exibir no SageMaker AI Insights.
  • Navegação direta: console do CloudWatch → Monitoramento da infraestruturaSageMaker AI Insights.

Guia Desempenho

A guia Desempenho responde a “está íntegro?” e “por que está lento?” — fluindo da integridade de toda a frota na parte superior para o diagnóstico por IC na parte inferior.

Integridade do desempenho

Hexágonos agrupados por AZ, mostrando rapidamente o estado dos alarmes das instâncias, cópias de IC e endpoints.

Combinações de desempenho e integridade mostrando o estado dos alarmes por AZ.
Tabela de desempenho da instância

Detalhamento por instância mostrando TTFT (P50/P99), TPS de saída (avg/max), solicitações simultâneas (live/max) e utilização do cache em KV.

Tabela de desempenho da instância mostrando TTFT, TPS de saída, solicitações simultâneas e cache KV.
Transmissão de tokens

Gráfico de séries temporais mostrando TTFT e latência entre tokens (ITL) com uma alternância P50/P99, dividida por estrutura.

Gráfico de transmissão de tokens mostrando TTFT e ITL P50/P99 ao longo do tempo.
Throughput do token

Tokens de entrada e saída por segundo por estrutura, com alternâncias para visualizações de entrada/saída, percentis e por instância.

Gráfico de throughput de tokens mostrando tokens de entrada e saída por segundo.
Carga do mecanismo e da solicitação

Utilização do cache KV (%), solicitações em execução e solicitações em espera ao longo do tempo — principais sinais de saturação para o mecanismo de inferência.

Painel de carga do mecanismo e da solicitação mostrando cache de KV, solicitações em execução e solicitações em espera.
Distribuição de tráfego

Tabela por instância ou por cópia de IC mostrando invocações por minuto, taxa 4XX e taxa 5XX para identificar desequilíbrios de roteamento.

Tabela de distribuição de tráfego mostrando invocações por minuto, taxa de 4XX e taxa de 5XX por instância.
Mistura de erros ao longo do tempo

Gráfico de linhas mostrando taxas de erro de 4XX, 5XX e durante o processamento ao longo do tempo por IC.

Mistura de erros ao longo do gráfico da linha do tempo mostrando erros 4XX, 5XX e durante o processamento.
Detalhamento da latência ao longo do tempo

Gráfico de áreas empilhadas com guias para Invocar (latência do modelo + latência de sobrecarga) e Transmissão (modelo do primeiro bloco + sobrecarga do primeiro bloco), com uma alternância P50/P90.

Detalhamento da latência ao longo do tempo. Gráfico de áreas empilhadas mostrando a latência do modelo e a latência da sobrecarga.

Guia Capacidade

A guia Capacidade responde a “eu tenho espaço livre?” e “meu hardware está íntegro?” — mostrando a utilização real em comparação com a capacidade reservada.

Integridade da capacidade

A mesma visualização em hexágono da guia Desempenho, mostrando o estado do alarme para instâncias, cópias de IC e endpoints.

Hexágonos de integridade da capacidade mostrando o estado de alarme por AZ.
Tabela de capacidade de instância

Barras de utilização por instância para GPU, memória de GPU, CPU, memória e disco.

Tabela de capacidade de instância mostrando utilização de GPU, memória de GPU, CPU, memória e disco.
Utilização da frota

Séries temporais mostrando utilização de CPU, GPU, memória de GPU, memória e disco por instância, com opções para instâncias, cópias de IC e visualizações de endpoint.

Gráfico de utilização da frota que mostra a utilização de CPU, GPU, memória de GPU, memória e disco por instância ao longo do tempo.

Guia Confiabilidade

A guia Confiabilidade responde a “é resiliente?” e “por que o escalonamento falhou?” — abrangendo a distribuição de AZ, o comportamento de escalabilidade e os eventos de provisionamento.

Distribuição de zonas de disponibilidade

Gráfico de barras mostrando a contagem de instâncias ou cópias do IC por AZ para validar a conformidade com a alta disponibilidade (HA).

Gráfico de barras de distribuição da zona de disponibilidade mostrando a contagem de instâncias por AZ.
Anatomia da inicialização a frio

Barra horizontal empilhada mostrando a divisão do tempo de provisionamento em download do modelo, carga da GPU, início do contêiner e sobrecarga da plataforma (somente endpoints IC).

Anatomia da inicialização a frio mostrando o download do modelo, a carga da GPU, a inicialização do contêiner e a sobrecarga da plataforma.
Diagnósticos do ICE

Contagem insuficiente de erros de capacidade (ICE) ao longo do tempo com uma tabela de eventos mostrando hora, endpoint, tipo de instância com falha e AZ com falha. Valores diferentes de zero indicam restrições de capacidade.

Painel de diagnósticos de ICE mostrando a contagem de ICE ao longo do tempo e uma tabela de eventos.