Le traduzioni sono generate tramite traduzione automatica. In caso di conflitto tra il contenuto di una traduzione e la versione originale in Inglese, quest'ultima prevarrà.
SageMaker Dashboard di AI Insights
La dashboard di SageMaker AI Insights è organizzata in tre schede: Prestazioni, Capacità e Affidabilità. Ogni scheda offre una visione mirata dello stato degli endpoint di inferenza.
Layout del dashboard
Barra di riassunto
La barra di riepilogo nella parte superiore della dashboard mostra i totali dell'intero parco veicoli.
| Metrica | Description |
|---|---|
| Invocazioni | Richiamazioni totali su tutti gli endpoint nell'intervallo di tempo selezionato |
| Istanze | Numero totale di istanze che attualmente servono traffico |
| Componenti di inferenza | Numero totale di componenti di inferenza su tutti gli endpoint |
| Inclinazione media A-Z | Squilibrio medio nella distribuzione delle zone di disponibilità (0% = perfettamente bilanciato) |
Pannello dei filtri
| Filtro | Description |
|---|---|
| Endpoint | Seleziona un endpoint specifico o Tutti gli endpoint per la visualizzazione della flotta |
| Istanza | Seleziona un'istanza specifica (richiede che sia stato prima selezionato un endpoint) |
| Componente di inferenza | Seleziona un IC specifico per il filtraggio granulare |
Drill-down
SageMaker AI Insights supporta il drill-down progressivo.
Livello di flotta (impostazione predefinita): tutti gli endpoint sono visibili, metriche di riepilogo aggregate
Livello di endpoint: seleziona un endpoint dal pannello dei filtri o scegli un link endpoint in qualsiasi tabella
Livello IC: seleziona un componente di inferenza dal pannello dei filtri
Cross-linking con la console AI SageMaker
Scegli il nome di un endpoint per aprire la pagina dei dettagli dell'endpoint nella console SageMaker AI.
Scegli Visualizza registri per aprire i CloudWatch registri filtrati in base a quell'endpoint o IC.
Dalla console SageMaker AI, scegli Visualizza in SageMaker AI Insights o Metrics per una riga per IC.
Accesso al pannello di controllo
Puoi accedere alla dashboard di SageMaker AI Insights da più posizioni nella console.
-
Dalla pagina dell'elenco degli endpoint: scegli Visualizza in SageMaker AI Insights per aprire la dashboard a livello di flotta senza applicare filtri.
-
Dalla pagina dei dettagli dell'endpoint: scegli Visualizza in SageMaker AI Insights per aprire la dashboard filtrata in base a quell'endpoint.
-
Dalla pagina dei dettagli del componente di inferenza: scegli Visualizza in SageMaker AI Insights per aprire la dashboard filtrata in base all'endpoint e al componente di inferenza.
Navigazione diretta: CloudWatch console → Monitoraggio dell'infrastruttura → SageMaker AI Insights.
Scheda Prestazioni
La scheda Prestazioni risponde «è salutare?» e «perché è lento?» —passando dalla diagnostica dell'intero parco macchine, nella parte superiore, alla diagnostica Per‐IC nella parte inferiore.
- Stato delle prestazioni
-
Honeycomb raggruppati per AZ che mostrano lo stato di allarme per istanze, copie IC ed endpoint a colpo d'occhio.
- Tabella delle prestazioni delle istanze
-
Analisi per istanza che mostra TTFT (P50/P99), output TPS (), richieste concorrenti (avg/max) e utilizzo della cache KVlive/max.
- Streaming di token
-
Grafico delle serie temporali che mostra TTFT e la latenza tra token (ITL) con un P50/P99 interruttore, suddiviso per framework.
- Produttività dei token
-
Token di input e output al secondo per framework, con opzioni per le visualizzazioni Percentili e Per Input/Output istanza.
- Motore e pressione di richiesta
-
Utilizzo della cache KV (%), richieste in esecuzione e richieste in attesa nel tempo: segnali di saturazione chiave per il motore di inferenza.
- Distribuzione del traffico
-
Tabella per istanza o per copia IC che mostra le chiamate al minuto, la frequenza 4XX e la frequenza 5XX per identificare gli squilibri di routing.
- Miscela di errori nel tempo
-
Grafico a linee che mostra i tassi di errore 4XX, 5XX e mid‐stream nel tempo per IC.
- Ripartizione della latenza nel tempo
-
Grafico ad area in pila con schede per Invoke (latenza del modello+latenza generale) e Streaming (modello del primo blocco + sovraccarico del primo blocco), con interruttore. P50/P90
Scheda Capacità
La scheda Capacità risponde «ho spazio per la testa?» e «il mio hardware è integro?» —che mostra l'utilizzo effettivo rispetto alla capacità riservata.
- Stato della capacità
-
La stessa visualizzazione a nido d'ape della scheda Prestazioni, che mostra lo stato di allarme per istanze, copie IC ed endpoint.
- Tabella della capacità delle istanze
-
Barre di utilizzo per istanza per GPU, memoria GPU, CPU, memoria e disco.
- Utilizzo del parco veicoli
-
Serie temporali che mostrano l'utilizzo di CPU, GPU, memoria GPU, memoria e disco per istanza, con opzioni per istanze, copie IC e visualizzazioni degli endpoint.
Scheda Affidabilità
La scheda Affidabilità risponde «è resiliente?» e «perché la scalabilità non è riuscita?» —copre la distribuzione AZ, il comportamento di scalabilità e gli eventi di provisioning.
- Distribuzione delle zone di disponibilità
-
Grafico a barre che mostra il numero di istanze o copie IC per AZ per convalidare la conformità all'alta disponibilità (HA).
- Anatomia con avviamento a freddo
-
Barra impilata orizzontale che mostra la ripartizione del tempo di provisioning in download del modello, carico della GPU, avvio del contenitore e sovraccarico della piattaforma (solo endpoint IC).
- Diagnostica ICE
-
Conteggio degli errori di capacità (ICE) insufficiente nel tempo con una tabella degli eventi che mostra l'ora, l'endpoint, il tipo di istanza non riuscita e la zona di errore. I valori diversi da zero indicano vincoli di capacità.