Die vorliegende Übersetzung wurde maschinell erstellt. Im Falle eines Konflikts oder eines Widerspruchs zwischen dieser übersetzten Fassung und der englischen Fassung (einschließlich infolge von Verzögerungen bei der Übersetzung) ist die englische Fassung maßgeblich.
CloudWatch SageMaker Einblicke in KI
Verwenden Sie CloudWatch SageMaker AI Insights, um KI-Inferenzendpunkte in großem Umfang zu überwachen und Fehler zu beheben SageMaker . Das Dashboard zeigt kuratierte Metriken und Visualisierungen in drei Ansichten — Leistung, Kapazität und Zuverlässigkeit — an, sodass Sie Probleme schnell identifizieren, die Ressourcennutzung optimieren und eine hohe Verfügbarkeit an Ihren Endpunkten sicherstellen können.
SageMaker AI Insights unterstützt die Überwachung verschiedener Endpunkttypen (Einzelmodell-Endpunkte und auf Inferenzkomponenten (IC) basierende Endpunkte) und Inferenz-Frameworks (vLLM, SGlang, TensorRT-LLM).
Informationen SageMaker zu den ersten Schritten mit AI Insights finden Sie in den folgenden Themen.
Topics
Die wichtigsten Funktionen
OpenTelemetry‐native Sammlung. Metriken werden mithilfe eines OTel Collectors erfasst, der Prometheus-Endpunkte aus DCGM (GPU-Metriken), Node-Exportern (CPU, Speicher, Festplatte) und Inferenz-Framework-Containern (vLLM, SGLang) extrahiert.
Etiketten mit reichhaltigen Abmessungen. Jede Metrik enthält Bezeichnungen wie
aws.sagemaker.endpoint.nameaws.sagemaker.inference_component.name,@resource.host.id,@resource.cloud.availability_zone, und@resource.host.type.Zuordnung pro GPU. GPU-Metriken (DCGM) beinhalten die Zuordnung pro Inferenzkomponente für Multi-Tenant-Instances.
Metriken für das Inferenz-Framework. Systemeigene VLLM- und SGLang-Metriken — Tokens pro Sekunde, Time to First Token (TTFT), Latenz zwischen den Tokens, KV-Cache-Nutzung, Warteschlangentiefe, Batchgröße — ohne benutzerdefinierte Instrumentierung.
Unterstützung für ProMQL-Abfragen. Fragen Sie in CloudWatch, CloudWatch Query Studio oder Amazon Managed Grafana ab.
Konfigurierbare Scrape-Frequenz. Einstellung über
MetricPublishFrequencyInSeconds(10, 30, 60, 120, 180, 240 oder 300 Sekunden; Standard 60). Die Metriken der Kontrollebene sind ereignisgesteuert.
Architektur und Datenfluss
Der Modellcontainer, der DCGM-Exporter und der Node-Exporter stellen Promethus-kompatible Metriken für die Instanz bereit.
Der OTel Collector scannt diese Endpunkte und reichert jede Metrik mit Bezeichnungen an (Endpunktname, IC-Name, Instanz-ID, AZ).
Angereicherte Metriken werden über OTLP nach exportiert. CloudWatch
Metriken können über PromQL in abgefragt werden. CloudWatch
┌─────────────────────────────────────────────────────────────────┐ │ SageMaker Endpoint Instance │ │ │ │ ┌──────────────┐ ┌──────────────┐ ┌──────────────────────┐ │ │ │ Model │ │ DCGM │ │ Node Exporter │ │ │ │ Container │ │ Exporter │ │ (CPU/Mem/Disk) │ │ │ │ (vLLM/SGLang)│ │ (GPU) │ │ │ │ │ └──────┬───────┘ └──────┬───────┘ └──────────┬───────────┘ │ │ │ │ │ │ │ └─────────────────┼─────────────────────┘ │ │ ▼ │ │ ┌─────────────────────────┐ │ │ │ OTel Collector │ │ │ │ (scrape + enrich) │ │ │ └────────────┬────────────┘ │ └───────────────────────────┼───────────────────────────────────────┘ │ OTLP ▼ ┌─────────────────────────┐ │ Amazon CloudWatch │ │ (PromQL-queryable) │ └─────────────────────────┘
So greift man zu
Sie können SageMaker AI Insights von der SageMaker KI-Konsole aus öffnen, indem Sie einen der folgenden Pfade verwenden.
| Quelle | Action | Ziel |
|---|---|---|
| SageMaker AI-Konsole → Liste der Endpunkte | Wählen Sie Open SageMaker AI Insights | Dashboard auf Flottenebene (kein Filter) |
| SageMaker AI-Konsole → Endpunkt-Detailseite | Wählen Sie In SageMaker AI Insights anzeigen | Das Dashboard wurde auf diesen Endpunkt gefiltert |
| SageMaker AI-Konsole → Registerkarte IC → Pro IC-Zeile | Wählen Sie Metriken | Das Dashboard wurde nach Endpunkt und Inferenzkomponente gefiltert |
Sie können auch direkt durch die CloudWatch Konsole navigieren, indem Sie Infrastrukturüberwachung → SageMaker KI Insights wählen.
Voraussetzungen
Mindestens ein SageMaker KI-Inferenzendpunkt im Status
InServiceEnableDetailedObservabilityin der Endpunktkonfigurationtrueauf gesetzt (Standard für neue Endpunkte)Die oTEL-Anreicherung ist in Ihrem Konto aktiviert
Die
cloudwatch:GetMetricDataundcloudwatch:ListMetricsIAM-Berechtigungen
Weitere Informationen finden Sie unter Erste Schritte mit CloudWatch SageMaker AI Insights.
Preisgestaltung
CloudWatch OpenTelemetry Es gilt die metrische Erfassung. Weitere Informationen finden Sie unter CloudWatch Amazon-Preise