Painel do SageMaker AI Insights
O painel do SageMaker AI Insights é organizado em três guias: Desempenho, Capacidade e Confiabilidade. Cada guia fornece uma visão focada da integridade do seu endpoint de inferência.
Layout do painel
Barra de resumo
A barra de resumo na parte superior do painel mostra os totais de toda a frota.
| Métrica | Descrição |
|---|---|
| Invocations | Total de invocações em todos os endpoints no intervalo de tempo selecionado |
| Instâncias | Número total de instâncias que atendem ao tráfego |
| Componentes de inferência | Número total de componentes de inferência em todos os endpoints |
| Avg AZ Skew | Desequilíbrio médio na distribuição da zona de disponibilidade (0% = perfeitamente equilibrado) |
Painel de filtros
| Filtro | Descrição |
|---|---|
| Endpoint | Selecione um endpoint específico ou Todos os endpoints para a visualização da frota |
| Instância | Selecione uma instância específica (requer que um endpoint seja selecionado primeiro) |
| Componente de inferência | Selecione um IC específico para filtragem granular |
Detalhar
O SageMaker AI Insights é compatível com o detalhamento progressivo.
Nível da frota (padrão): todos os endpoints visíveis, métricas resumidas agregadas
Nível do endpoint: selecione um endpoint no painel de filtro ou escolha um link de endpoint em qualquer tabela
Nível de IC: selecione um componente de inferência no painel de filtro
Vinculação cruzada com o console do SageMaker AI
Selecione um nome de endpoint para abrir a página de detalhes do endpoint no console do SageMaker AI.
Escolha Exibir logs para abrir os logs do CloudWatch Logs filtrados para esse endpoint ou IC.
No console do SageMaker AI, escolha Exibir no SageMaker AI Insights ou Métricas para uma linha por IC.
Acessar o painel
Você pode acessar o painel do SageMaker AI Insights de vários locais no console.
-
Na página da lista de endpoints: escolha Exibir no SageMaker AI Insights para abrir o painel no nível da frota sem a aplicação de filtros.
-
Na página de detalhes do endpoint: escolha Exibir no SageMaker AI Insights para abrir o painel filtrado para esse endpoint.
-
Na página de detalhes do componente de inferência: escolha Exibir no SageMaker AI Insights para abrir o painel filtrado para esse endpoint e componente de inferência.
Navegação direta: console do CloudWatch → Monitoramento da infraestrutura → SageMaker AI Insights.
Guia Desempenho
A guia Desempenho responde a “está íntegro?” e “por que está lento?” — fluindo da integridade de toda a frota na parte superior para o diagnóstico por IC na parte inferior.
- Integridade do desempenho
-
Hexágonos agrupados por AZ, mostrando rapidamente o estado dos alarmes das instâncias, cópias de IC e endpoints.
- Tabela de desempenho da instância
-
Detalhamento por instância mostrando TTFT (P50/P99), TPS de saída (avg/max), solicitações simultâneas (live/max) e utilização do cache em KV.
- Transmissão de tokens
-
Gráfico de séries temporais mostrando TTFT e latência entre tokens (ITL) com uma alternância P50/P99, dividida por estrutura.
- Throughput do token
-
Tokens de entrada e saída por segundo por estrutura, com alternâncias para visualizações de entrada/saída, percentis e por instância.
- Carga do mecanismo e da solicitação
-
Utilização do cache KV (%), solicitações em execução e solicitações em espera ao longo do tempo — principais sinais de saturação para o mecanismo de inferência.
- Distribuição de tráfego
-
Tabela por instância ou por cópia de IC mostrando invocações por minuto, taxa 4XX e taxa 5XX para identificar desequilíbrios de roteamento.
- Mistura de erros ao longo do tempo
-
Gráfico de linhas mostrando taxas de erro de 4XX, 5XX e durante o processamento ao longo do tempo por IC.
- Detalhamento da latência ao longo do tempo
-
Gráfico de áreas empilhadas com guias para Invocar (latência do modelo + latência de sobrecarga) e Transmissão (modelo do primeiro bloco + sobrecarga do primeiro bloco), com uma alternância P50/P90.
Guia Capacidade
A guia Capacidade responde a “eu tenho espaço livre?” e “meu hardware está íntegro?” — mostrando a utilização real em comparação com a capacidade reservada.
- Integridade da capacidade
-
A mesma visualização em hexágono da guia Desempenho, mostrando o estado do alarme para instâncias, cópias de IC e endpoints.
- Tabela de capacidade de instância
-
Barras de utilização por instância para GPU, memória de GPU, CPU, memória e disco.
- Utilização da frota
-
Séries temporais mostrando utilização de CPU, GPU, memória de GPU, memória e disco por instância, com opções para instâncias, cópias de IC e visualizações de endpoint.
Guia Confiabilidade
A guia Confiabilidade responde a “é resiliente?” e “por que o escalonamento falhou?” — abrangendo a distribuição de AZ, o comportamento de escalabilidade e os eventos de provisionamento.
- Distribuição de zonas de disponibilidade
-
Gráfico de barras mostrando a contagem de instâncias ou cópias do IC por AZ para validar a conformidade com a alta disponibilidade (HA).
- Anatomia da inicialização a frio
-
Barra horizontal empilhada mostrando a divisão do tempo de provisionamento em download do modelo, carga da GPU, início do contêiner e sobrecarga da plataforma (somente endpoints IC).
- Diagnósticos do ICE
-
Contagem insuficiente de erros de capacidade (ICE) ao longo do tempo com uma tabela de eventos mostrando hora, endpoint, tipo de instância com falha e AZ com falha. Valores diferentes de zero indicam restrições de capacidade.