View a markdown version of this page

CloudWatch SageMaker Einblicke in KI - Amazon CloudWatch

Die vorliegende Übersetzung wurde maschinell erstellt. Im Falle eines Konflikts oder eines Widerspruchs zwischen dieser übersetzten Fassung und der englischen Fassung (einschließlich infolge von Verzögerungen bei der Übersetzung) ist die englische Fassung maßgeblich.

CloudWatch SageMaker Einblicke in KI

Verwenden Sie CloudWatch SageMaker AI Insights, um KI-Inferenzendpunkte in großem Umfang zu überwachen und Fehler zu beheben SageMaker . Das Dashboard zeigt kuratierte Metriken und Visualisierungen in drei Ansichten — Leistung, Kapazität und Zuverlässigkeit — an, sodass Sie Probleme schnell identifizieren, die Ressourcennutzung optimieren und eine hohe Verfügbarkeit an Ihren Endpunkten sicherstellen können.

SageMaker AI Insights unterstützt die Überwachung verschiedener Endpunkttypen (Einzelmodell-Endpunkte und auf Inferenzkomponenten (IC) basierende Endpunkte) und Inferenz-Frameworks (vLLM, SGlang, TensorRT-LLM).

Informationen SageMaker zu den ersten Schritten mit AI Insights finden Sie in den folgenden Themen.

Die wichtigsten Funktionen

  • OpenTelemetry‐native Sammlung. Metriken werden mithilfe eines OTel Collectors erfasst, der Prometheus-Endpunkte aus DCGM (GPU-Metriken), Node-Exportern (CPU, Speicher, Festplatte) und Inferenz-Framework-Containern (vLLM, SGLang) extrahiert.

  • Etiketten mit reichhaltigen Abmessungen. Jede Metrik enthält Bezeichnungen wie aws.sagemaker.endpoint.nameaws.sagemaker.inference_component.name,@resource.host.id,@resource.cloud.availability_zone, und@resource.host.type.

  • Zuordnung pro GPU. GPU-Metriken (DCGM) beinhalten die Zuordnung pro Inferenzkomponente für Multi-Tenant-Instances.

  • Metriken für das Inferenz-Framework. Systemeigene VLLM- und SGLang-Metriken — Tokens pro Sekunde, Time to First Token (TTFT), Latenz zwischen den Tokens, KV-Cache-Nutzung, Warteschlangentiefe, Batchgröße — ohne benutzerdefinierte Instrumentierung.

  • Unterstützung für ProMQL-Abfragen. Fragen Sie in CloudWatch, CloudWatch Query Studio oder Amazon Managed Grafana ab.

  • Konfigurierbare Scrape-Frequenz. Einstellung über MetricPublishFrequencyInSeconds (10, 30, 60, 120, 180, 240 oder 300 Sekunden; Standard 60). Die Metriken der Kontrollebene sind ereignisgesteuert.

Architektur und Datenfluss

  1. Der Modellcontainer, der DCGM-Exporter und der Node-Exporter stellen Promethus-kompatible Metriken für die Instanz bereit.

  2. Der OTel Collector scannt diese Endpunkte und reichert jede Metrik mit Bezeichnungen an (Endpunktname, IC-Name, Instanz-ID, AZ).

  3. Angereicherte Metriken werden über OTLP nach exportiert. CloudWatch

  4. Metriken können über PromQL in abgefragt werden. CloudWatch

┌─────────────────────────────────────────────────────────────────┐ │ SageMaker Endpoint Instance │ │ │ │ ┌──────────────┐ ┌──────────────┐ ┌──────────────────────┐ │ │ │ Model │ │ DCGM │ │ Node Exporter │ │ │ │ Container │ │ Exporter │ │ (CPU/Mem/Disk) │ │ │ │ (vLLM/SGLang)│ │ (GPU) │ │ │ │ │ └──────┬───────┘ └──────┬───────┘ └──────────┬───────────┘ │ │ │ │ │ │ │ └─────────────────┼─────────────────────┘ │ │ ▼ │ │ ┌─────────────────────────┐ │ │ │ OTel Collector │ │ │ │ (scrape + enrich) │ │ │ └────────────┬────────────┘ │ └───────────────────────────┼───────────────────────────────────────┘ │ OTLP ▼ ┌─────────────────────────┐ │ Amazon CloudWatch │ │ (PromQL-queryable) │ └─────────────────────────┘

So greift man zu

Sie können SageMaker AI Insights von der SageMaker KI-Konsole aus öffnen, indem Sie einen der folgenden Pfade verwenden.

Quelle Action Ziel
SageMaker AI-Konsole → Liste der Endpunkte Wählen Sie Open SageMaker AI Insights Dashboard auf Flottenebene (kein Filter)
SageMaker AI-Konsole → Endpunkt-Detailseite Wählen Sie In SageMaker AI Insights anzeigen Das Dashboard wurde auf diesen Endpunkt gefiltert
SageMaker AI-Konsole → Registerkarte IC → Pro IC-Zeile Wählen Sie Metriken Das Dashboard wurde nach Endpunkt und Inferenzkomponente gefiltert

Sie können auch direkt durch die CloudWatch Konsole navigieren, indem Sie InfrastrukturüberwachungSageMaker KI Insights wählen.

Voraussetzungen

  • Mindestens ein SageMaker KI-Inferenzendpunkt im Status InService

  • EnableDetailedObservabilityin der Endpunktkonfiguration true auf gesetzt (Standard für neue Endpunkte)

  • Die oTEL-Anreicherung ist in Ihrem Konto aktiviert

  • Die cloudwatch:GetMetricData und cloudwatch:ListMetrics IAM-Berechtigungen

Weitere Informationen finden Sie unter Erste Schritte mit CloudWatch SageMaker AI Insights.

Preisgestaltung

CloudWatch OpenTelemetry Es gilt die metrische Erfassung. Weitere Informationen finden Sie unter CloudWatch Amazon-Preise.