View a markdown version of this page

CloudWatch SageMaker Informations sur l'IA - Amazon CloudWatch

Les traductions sont fournies par des outils de traduction automatique. En cas de conflit entre le contenu d'une traduction et celui de la version originale en anglais, la version anglaise prévaudra.

CloudWatch SageMaker Informations sur l'IA

Utilisez CloudWatch SageMaker AI Insights pour surveiller et dépanner les points de terminaison d'inférence SageMaker basés sur l'IA à grande échelle. Le tableau de bord affiche des indicateurs et des visualisations sélectionnés sous trois angles (performance, capacité et fiabilité) afin que vous puissiez identifier rapidement les problèmes, optimiser l'utilisation des ressources et garantir une haute disponibilité sur tous vos terminaux.

SageMaker AI Insights prend en charge la surveillance de différents types de terminaux (points de terminaison à modèle unique et points de terminaison basés sur des composants d'inférence (IC)) et de cadres d'inférence (vLLM, SGlang, TensorRT‐LLM).

Pour commencer à utiliser SageMaker AI Insights, consultez les rubriques suivantes.

Capacités clés

  • OpenTelemetry‐collection native. Les métriques sont collectées à l'aide d'un collecteur OTel qui extrait les points de terminaison Prometheus du DCGM (métriques du GPU), des exportateurs de nœuds (CPU, mémoire, disque) et des conteneurs du framework d'inférence (vLLM, SGlang).

  • Étiquettes dimensionnelles riches. Chaque métrique inclut des étiquettes telles que aws.sagemaker.endpoint.nameaws.sagemaker.inference_component.name,@resource.host.id,@resource.cloud.availability_zone, et@resource.host.type.

  • Attribution par GPU. Les métriques GPU (DCGM) incluent l'attribution par composant d'inférence pour les instances multi-locataires.

  • Métriques du cadre d'inférence. Mesures vLLM et SGlang natives (jetons par seconde, délai jusqu'au premier jeton (TTFT), latence entre les jetons, utilisation du cache KV, profondeur de file d'attente, taille du lot, sans instrumentation personnalisée.

  • Support des requêtes ProMQL. Query in CloudWatch, CloudWatch Query Studio ou Amazon Managed Grafana.

  • Fréquence de raclage configurable. Réglé via MetricPublishFrequencyInSeconds (10, 30, 60, 120, 180, 240 ou 300 secondes ; 60 par défaut). Les métriques du plan de contrôle sont pilotées par les événements.

Architecture et flux de données

  1. Le conteneur modèle, l'exportateur DCGM et l'exportateur de nœuds exposent les métriques compatibles avec Prometheus sur l'instance.

  2. Le collecteur OTel supprime ces points de terminaison et enrichit chaque métrique d'étiquettes (nom du point de terminaison, nom du circuit intégré, ID d'instance, AZ).

  3. Les métriques enrichies sont exportées via OTLP vers. CloudWatch

  4. Les métriques sont interrogeables via ProMQL dans. CloudWatch

┌─────────────────────────────────────────────────────────────────┐ │ SageMaker Endpoint Instance │ │ │ │ ┌──────────────┐ ┌──────────────┐ ┌──────────────────────┐ │ │ │ Model │ │ DCGM │ │ Node Exporter │ │ │ │ Container │ │ Exporter │ │ (CPU/Mem/Disk) │ │ │ │ (vLLM/SGLang)│ │ (GPU) │ │ │ │ │ └──────┬───────┘ └──────┬───────┘ └──────────┬───────────┘ │ │ │ │ │ │ │ └─────────────────┼─────────────────────┘ │ │ ▼ │ │ ┌─────────────────────────┐ │ │ │ OTel Collector │ │ │ │ (scrape + enrich) │ │ │ └────────────┬────────────┘ │ └───────────────────────────┼───────────────────────────────────────┘ │ OTLP ▼ ┌─────────────────────────┐ │ Amazon CloudWatch │ │ (PromQL-queryable) │ └─────────────────────────┘

Comment accéder

Vous pouvez ouvrir SageMaker AI Insights depuis la console SageMaker AI en utilisant l'un des chemins suivants.

Source Action Destination
SageMaker Console AI → Liste des points de terminaison Choisissez Open SageMaker AI Insights Tableau de bord au niveau de la flotte (aucun filtre)
SageMaker Console AI → page détaillée du point de terminaison Choisissez Afficher dans SageMaker AI Insights Tableau de bord filtré pour ce point de terminaison
SageMaker Console AI → onglet IC → Ligne par circuit intégré Choisissez Metrics Tableau de bord filtré selon le point de terminaison et le composant d'inférence

Vous pouvez également naviguer directement dans la CloudWatch console en choisissant Surveillance de l'infrastructureSageMaker AI Insights.

Conditions préalables

  • Au moins un point de terminaison d'inférence SageMaker AI dans le statut InService

  • EnableDetailedObservabilitydéfini true sur la configuration du point de terminaison (par défaut pour les nouveaux points de terminaison)

  • Enrichissement par OTel activé sur votre compte

  • Les cloudwatch:GetMetricData autorisations et cloudwatch:ListMetrics IAM

Pour de plus amples informations, veuillez consulter Commencez avec CloudWatch SageMaker AI Insights.

Tarification

CloudWatch OpenTelemetry l'ingestion métrique s'applique. Pour plus d'informations, consultez Amazon CloudWatch Pricing.