View a markdown version of this page

SageMaker AI Insights-Dashboard - Amazon CloudWatch

Die vorliegende Übersetzung wurde maschinell erstellt. Im Falle eines Konflikts oder eines Widerspruchs zwischen dieser übersetzten Fassung und der englischen Fassung (einschließlich infolge von Verzögerungen bei der Übersetzung) ist die englische Fassung maßgeblich.

SageMaker AI Insights-Dashboard

Das SageMaker AI Insights-Dashboard ist in drei Registerkarten unterteilt: Leistung, Kapazität und Zuverlässigkeit. Jede Registerkarte bietet einen detaillierten Überblick über den Zustand Ihres Inferenzendpunkts.

Aufbau des Dashboards

Übersichtsleiste

In der Übersichtsleiste oben im Dashboard werden Gesamtsummen für die gesamte Flotte angezeigt.

SageMaker Kopfzeile des AI Insights-Dashboards mit Übersichtsleiste mit Aufrufen, Instanzen, Inferenzkomponenten und Avg AZ Skew.
MetrikDescription
AufrufeGesamtzahl der Aufrufe auf allen Endpunkten im ausgewählten Zeitraum
InstancesGesamtzahl der Instances, die derzeit Traffic verarbeiten
InferenzkomponentenGesamtzahl der Inferenzkomponenten an allen Endpunkten
Durchschnittliche AZ-SchräglageDurchschnittliches Ungleichgewicht bei der Verteilung der Verfügbarkeitszonen (0% = perfekt ausgewogen)

Bedienfeld „Filter“

FilterDescription
EndpointWählen Sie einen bestimmten Endpunkt oder Alle Endpunkte für die Flottenansicht
InstanceWählen Sie eine bestimmte Instanz aus (erfordert, dass zuerst ein Endpunkt ausgewählt wird)
InferenzkomponenteWählen Sie einen bestimmten IC für die granulare Filterung

Drill-down

SageMaker AI Insights unterstützt progressiven Drill‐Down.

  1. Flottenebene (Standard) — alle Endpunkte sichtbar, zusammengefasste Kennzahlen

  2. Endpunktebene — Wählen Sie einen Endpunkt aus dem Filterbereich oder einen Endpunkt-Link in einer beliebigen Tabelle

  3. IC-Ebene — Wählen Sie eine Inferenzkomponente aus dem Filterfenster aus

Cross-linking mit der AI-Konsole SageMaker

  • Wählen Sie einen Endpunktnamen, um die Endpunkt-Detailseite in der SageMaker AI-Konsole zu öffnen.

  • Wählen Sie Protokolle anzeigen, um nach diesem Endpunkt oder IC gefilterte CloudWatch Protokolle zu öffnen.

  • Wählen Sie in der SageMaker AI-Konsole für eine Zeile pro IC die Option In SageMaker AI Insights anzeigen oder Metriken aus.

Zugriff auf das Dashboard

Sie können von mehreren Stellen in der Konsole auf das SageMaker AI Insights-Dashboard zugreifen.

  • Auf der Seite mit der Liste der Endpunkte: Wählen Sie In SageMaker AI Insights anzeigen aus, um das Dashboard auf Flottenebene zu öffnen, ohne dass Filter angewendet werden.

    Seite mit der Liste der Endpunkte mit der Schaltfläche „In SageMaker AI Insights anzeigen“.
  • Auf der Endpunkt-Detailseite: Wählen Sie In SageMaker AI Insights anzeigen aus, um das nach diesem Endpunkt gefilterte Dashboard zu öffnen.

    Endpunkt-Detailseite mit der Schaltfläche „In SageMaker AI Insights anzeigen“.
  • Auf der Detailseite der Inferenzkomponente: Wählen Sie In SageMaker AI Insights anzeigen aus, um das nach diesem Endpunkt und der Inferenzkomponente gefilterte Dashboard zu öffnen.

    Detailseite der Inferenzkomponente mit der Schaltfläche „In SageMaker AI Insights anzeigen“.
  • Direktnavigation: CloudWatch Konsole → InfrastrukturüberwachungSageMaker AI Insights.

Registerkarte „Leistung“

Auf der Registerkarte Leistung wird die Antwort „Ist es gesund?“ beantwortet und „Warum ist es langsam?“ — von der flächendeckenden Systemdiagnose an der Spitze bis hin zur Per-IC-Diagnose an der Unterseite.

Leistung, Gesundheit

Honeycombs, gruppiert nach AZ, zeigen den Alarmstatus für Instances, IC-Kopien und Endpunkte auf einen Blick.

Leistungsstarke Gesundheitswaben, die den Alarmstatus nach AZ anzeigen.
Tabelle zur Instanzleistung

Aufschlüsselung pro Instanz mit TTFT (P50/P99), Ausgabe-TPS (avg/max), gleichzeitigen Anfragen (live/max) und KV-Cache-Auslastung.

Instanzleistungstabelle mit TTFT, Ausgabe-TPS, gleichzeitigen Anfragen und KV-Cache.
Token-Streaming

Zeitreihendiagramm mit TTFT und Inter-Token-Latenz (ITL) mit einem P50/P99 Umschalter, aufgeschlüsselt nach Frameworks.

Token-Streaming-Diagramm, das TTFT und ITL im Zeitverlauf zeigt. P50/P99
Token-Durchsatz

Eingabe- und Ausgabetokens pro Sekunde nach Framework, mit Umschaltern für Input/Output die Ansichten „Perzentile“ und „Nach Instanz“.

Diagramm zum Token-Durchsatz mit Eingabe- und Ausgabetokens pro Sekunde.
Motor- und Anforderungsdruck

KV-Cache-Auslastung (%), laufende Anfragen und wartende Anfragen im Laufe der Zeit — wichtige Auslastungssignale für die Inferenz-Engine.

Druckanzeige für Engine und Anforderung, in der der KV-Cache, laufende Anfragen und wartende Anfragen angezeigt werden.
Verteilung des Datenverkehrs

Tabelle pro Instanz oder pro IC-Kopie mit Aufrufen pro Minute, 4XX-Rate und 5XX-Rate zur Identifizierung von Routing-Ungleichgewichten.

Tabelle zur Verteilung des Datenverkehrs mit Aufrufen pro Minute, 4XX-Rate und 5XX-Rate pro Instance.
Mischung von Fehlern im Laufe der Zeit

Liniendiagramm mit 4XX-, 5XX- und Midstream-Fehlerraten im Zeitverlauf pro IC.

Liniendiagramm zwischen Fehlermix und Zeitverlauf mit 4XX-, 5XX- und Mid-Stream-Fehlern.
Verteilung der Latenz im Laufe der Zeit

Gestapeltes Flächendiagramm mit Tabs für Invoke (Modell-Latenz + Overhead-Latenz) und Streaming (erstes Chunk-Modell + erster Chunk-Overhead) mit einem Umschalter. P50/P90

Aufschlüsselung der Latenz im Zeitverlauf, gestapeltes Flächendiagramm, das die Modelllatenz und die Overhead-Latenz zeigt.

Registerkarte „Kapazität“

Auf der Registerkarte „Kapazität“ wird die Frage „Habe ich Spielraum?“ beantwortet und „Ist meine Hardware gesund?“ — zeigt die tatsächliche Auslastung im Vergleich zur reservierten Kapazität.

Zustand der Kapazität

Dieselbe Wabenvisualisierung wie auf der Registerkarte „Leistung“, die den Alarmstatus für Instances, IC-Kopien und Endpunkte anzeigt.

Waben zur Kapazitätsintegrität, die den Alarmstatus nach AZ anzeigen.
Tabelle mit der Instanzkapazität

Auslastungsbalken pro Instanz für GPU, GPU-Speicher, CPU, Arbeitsspeicher und Festplatte.

Tabelle mit der Instanzkapazität, die die Auslastung von GPU, GPU-Speicher, CPU, Arbeitsspeicher und Festplatte anzeigt.
Flottenauslastung

Zeitreihe, die die CPU-, GPU-, GPU-Speicher-, Arbeitsspeicher- und Festplattenauslastung pro Instanz anzeigt, mit Umschaltern für Instance-, IC-Kopien- und Endpunktansichten.

Diagramm zur Flottenauslastung, das die CPU-, GPU-, GPU-Speicher-, Arbeitsspeicher- und Festplattenauslastung pro Instanz im Zeitverlauf zeigt.

Registerkarte „Zuverlässigkeit“

Auf der Registerkarte Zuverlässigkeit wird die Frage „Ist es belastbar?“ beantwortet und „Warum ist die Skalierung gescheitert?“ — behandelt die AZ-Verteilung, das Skalierungsverhalten und Bereitstellungsereignisse.

Verteilung von Availability Zones

Balkendiagramm, das die Anzahl der Instanzen oder IC-Kopien pro AZ anzeigt, um die Einhaltung der Hochverfügbarkeits- (HA) -Konformität zu überprüfen.

Balkendiagramm der Availability Zone, das die Anzahl der Instanzen pro AZ anzeigt.
Anatomie beim Kaltstart

Horizontaler gestapelter Balken, der die Aufschlüsselung der Bereitstellungszeit nach Modell-Download, GPU-Last, Container-Start und Plattform-Overhead zeigt (nur IC-Endpunkte).

Die Anatomie des Kaltstarts zeigt den Modell-Download, die GPU-Last, den Containerstart und den Plattform-Overhead.
ICE-Diagnose

Anzahl unzureichender Kapazitätsfehler (ICE) im Zeitverlauf mit einer Ereignistabelle, die Uhrzeit, Endpunkt, ausgefallener Instance-Typ und ausgefallene AZ anzeigt. Werte ungleich Null deuten auf Kapazitätsengpässe hin.

ICE-Diagnosetafel mit Anzeige der ICE-Anzahl im Zeitverlauf und einer Ereignistabelle.