Die vorliegende Übersetzung wurde maschinell erstellt. Im Falle eines Konflikts oder eines Widerspruchs zwischen dieser übersetzten Fassung und der englischen Fassung (einschließlich infolge von Verzögerungen bei der Übersetzung) ist die englische Fassung maßgeblich.
SageMaker AI Insights-Dashboard
Das SageMaker AI Insights-Dashboard ist in drei Registerkarten unterteilt: Leistung, Kapazität und Zuverlässigkeit. Jede Registerkarte bietet einen detaillierten Überblick über den Zustand Ihres Inferenzendpunkts.
Aufbau des Dashboards
Übersichtsleiste
In der Übersichtsleiste oben im Dashboard werden Gesamtsummen für die gesamte Flotte angezeigt.
| Metrik | Description |
|---|---|
| Aufrufe | Gesamtzahl der Aufrufe auf allen Endpunkten im ausgewählten Zeitraum |
| Instances | Gesamtzahl der Instances, die derzeit Traffic verarbeiten |
| Inferenzkomponenten | Gesamtzahl der Inferenzkomponenten an allen Endpunkten |
| Durchschnittliche AZ-Schräglage | Durchschnittliches Ungleichgewicht bei der Verteilung der Verfügbarkeitszonen (0% = perfekt ausgewogen) |
Bedienfeld „Filter“
| Filter | Description |
|---|---|
| Endpoint | Wählen Sie einen bestimmten Endpunkt oder Alle Endpunkte für die Flottenansicht |
| Instance | Wählen Sie eine bestimmte Instanz aus (erfordert, dass zuerst ein Endpunkt ausgewählt wird) |
| Inferenzkomponente | Wählen Sie einen bestimmten IC für die granulare Filterung |
Drill-down
SageMaker AI Insights unterstützt progressiven Drill‐Down.
Flottenebene (Standard) — alle Endpunkte sichtbar, zusammengefasste Kennzahlen
Endpunktebene — Wählen Sie einen Endpunkt aus dem Filterbereich oder einen Endpunkt-Link in einer beliebigen Tabelle
IC-Ebene — Wählen Sie eine Inferenzkomponente aus dem Filterfenster aus
Cross-linking mit der AI-Konsole SageMaker
Wählen Sie einen Endpunktnamen, um die Endpunkt-Detailseite in der SageMaker AI-Konsole zu öffnen.
Wählen Sie Protokolle anzeigen, um nach diesem Endpunkt oder IC gefilterte CloudWatch Protokolle zu öffnen.
Wählen Sie in der SageMaker AI-Konsole für eine Zeile pro IC die Option In SageMaker AI Insights anzeigen oder Metriken aus.
Zugriff auf das Dashboard
Sie können von mehreren Stellen in der Konsole auf das SageMaker AI Insights-Dashboard zugreifen.
-
Auf der Seite mit der Liste der Endpunkte: Wählen Sie In SageMaker AI Insights anzeigen aus, um das Dashboard auf Flottenebene zu öffnen, ohne dass Filter angewendet werden.
-
Auf der Endpunkt-Detailseite: Wählen Sie In SageMaker AI Insights anzeigen aus, um das nach diesem Endpunkt gefilterte Dashboard zu öffnen.
-
Auf der Detailseite der Inferenzkomponente: Wählen Sie In SageMaker AI Insights anzeigen aus, um das nach diesem Endpunkt und der Inferenzkomponente gefilterte Dashboard zu öffnen.
Direktnavigation: CloudWatch Konsole → Infrastrukturüberwachung → SageMaker AI Insights.
Registerkarte „Leistung“
Auf der Registerkarte Leistung wird die Antwort „Ist es gesund?“ beantwortet und „Warum ist es langsam?“ — von der flächendeckenden Systemdiagnose an der Spitze bis hin zur Per-IC-Diagnose an der Unterseite.
- Leistung, Gesundheit
-
Honeycombs, gruppiert nach AZ, zeigen den Alarmstatus für Instances, IC-Kopien und Endpunkte auf einen Blick.
- Tabelle zur Instanzleistung
-
Aufschlüsselung pro Instanz mit TTFT (P50/P99), Ausgabe-TPS (avg/max), gleichzeitigen Anfragen (live/max) und KV-Cache-Auslastung.
- Token-Streaming
-
Zeitreihendiagramm mit TTFT und Inter-Token-Latenz (ITL) mit einem P50/P99 Umschalter, aufgeschlüsselt nach Frameworks.
- Token-Durchsatz
-
Eingabe- und Ausgabetokens pro Sekunde nach Framework, mit Umschaltern für Input/Output die Ansichten „Perzentile“ und „Nach Instanz“.
- Motor- und Anforderungsdruck
-
KV-Cache-Auslastung (%), laufende Anfragen und wartende Anfragen im Laufe der Zeit — wichtige Auslastungssignale für die Inferenz-Engine.
- Verteilung des Datenverkehrs
-
Tabelle pro Instanz oder pro IC-Kopie mit Aufrufen pro Minute, 4XX-Rate und 5XX-Rate zur Identifizierung von Routing-Ungleichgewichten.
- Mischung von Fehlern im Laufe der Zeit
-
Liniendiagramm mit 4XX-, 5XX- und Midstream-Fehlerraten im Zeitverlauf pro IC.
- Verteilung der Latenz im Laufe der Zeit
-
Gestapeltes Flächendiagramm mit Tabs für Invoke (Modell-Latenz + Overhead-Latenz) und Streaming (erstes Chunk-Modell + erster Chunk-Overhead) mit einem Umschalter. P50/P90
Registerkarte „Kapazität“
Auf der Registerkarte „Kapazität“ wird die Frage „Habe ich Spielraum?“ beantwortet und „Ist meine Hardware gesund?“ — zeigt die tatsächliche Auslastung im Vergleich zur reservierten Kapazität.
- Zustand der Kapazität
-
Dieselbe Wabenvisualisierung wie auf der Registerkarte „Leistung“, die den Alarmstatus für Instances, IC-Kopien und Endpunkte anzeigt.
- Tabelle mit der Instanzkapazität
-
Auslastungsbalken pro Instanz für GPU, GPU-Speicher, CPU, Arbeitsspeicher und Festplatte.
- Flottenauslastung
-
Zeitreihe, die die CPU-, GPU-, GPU-Speicher-, Arbeitsspeicher- und Festplattenauslastung pro Instanz anzeigt, mit Umschaltern für Instance-, IC-Kopien- und Endpunktansichten.
Registerkarte „Zuverlässigkeit“
Auf der Registerkarte Zuverlässigkeit wird die Frage „Ist es belastbar?“ beantwortet und „Warum ist die Skalierung gescheitert?“ — behandelt die AZ-Verteilung, das Skalierungsverhalten und Bereitstellungsereignisse.
- Verteilung von Availability Zones
-
Balkendiagramm, das die Anzahl der Instanzen oder IC-Kopien pro AZ anzeigt, um die Einhaltung der Hochverfügbarkeits- (HA) -Konformität zu überprüfen.
- Anatomie beim Kaltstart
-
Horizontaler gestapelter Balken, der die Aufschlüsselung der Bereitstellungszeit nach Modell-Download, GPU-Last, Container-Start und Plattform-Overhead zeigt (nur IC-Endpunkte).
- ICE-Diagnose
-
Anzahl unzureichender Kapazitätsfehler (ICE) im Zeitverlauf mit einer Ereignistabelle, die Uhrzeit, Endpunkt, ausgefallener Instance-Typ und ausgefallene AZ anzeigt. Werte ungleich Null deuten auf Kapazitätsengpässe hin.