Les traductions sont fournies par des outils de traduction automatique. En cas de conflit entre le contenu d'une traduction et celui de la version originale en anglais, la version anglaise prévaudra.
SageMaker Référence des OpenTelemetry métriques d'AI Insights
Cette section fournit une liste complète des OpenTelemetry métriques émises par l'observabilité détaillée de l' SageMaker IA. L'observabilité détaillée repose sur OpenTelemetry (OTel) et collecte des métriques opérationnelles précises à partir des couches du GPU, des nœuds et du framework d'inférence, puis les publie sous forme de libellés enrichis. CloudWatch
L'observabilité détaillée publie des métriques OpenTelemetry (OTel) CloudWatch via OTLP. Ce ne sont pas des indicateurs de Prometheus. Les métriques sont stockées nativement sous forme de données métriques CloudWatch OTel et peuvent être interrogées à l'aide de la syntaxe ProMQL.
Account-level métriques agrégées
| Métrique | Type | Description |
TotalEndpoints | Regrouper | Nombre de points de terminaison du compte |
TotalICs | Regrouper | Nombre de tous les composants d'inférence |
TotalGPUs | Regrouper | Nombre de tous les GPU (dérivés deDCGM_FI_DEV_GPU_UTIL) |
Endpoint-level métriques
| Métrique | Type | Description |
InstanceCountPerEndpoint | Regrouper | Nombre d'instances desservant le trafic |
InstancesPerAZ | Regrouper | Instances par zone de disponibilité |
EmptyInstanceCount | Regrouper | Instances où aucun circuit intégré n'est placé |
ScalingAction | Raw | Événement de mise à l'échelle (in/out) |
ICECount | Raw | Nombre d'erreurs liées à une capacité insuffisante |
CPUUtilization(EP) | Regrouper | Endpoint-level Utilisation du processeur |
MemoryUtilization(EP) | Regrouper | Endpoint-level utilisation de la mémoire |
DiskUtilization(EP) | Regrouper | Endpoint-level utilisation du disque |
E2EScalingLatency | Raw | End-to-end durée du dimensionnement |
RebalancingType | Raw | Type d'événement de rééquilibrage |
RebalancingDuration | Raw | Durée du rééquilibrage (secondes) |
RebalancingCopiesMoved | Raw | Copies du circuit intégré déplacées lors du rééquilibrage |
AZSkewDelta | Raw | Déséquilibre de distribution AZ |
InstancesReleased | Raw | Instances libérées par le rééquilibrage |
Métriques du cadre d'inférence (VLLm/SGLang)
| Métrique | Type | Description |
InputTokensPerSecond | Regrouper | Taux de jetons d'entrée |
OutputTokensPerSecond | Regrouper | Taux de jetons de sortie |
TotalTPS | Regrouper | Total de jetons par seconde |
TPSUtilization | Regrouper | Pourcentage d'utilisation du TPS |
TTFT | Raw | Délai jusqu'au premier jeton (histogramme) |
InterTokenLatency | Raw | Inter-Token Latence (histogramme) |
KVCacheUtilization | Raw | Pourcentage d'utilisation du cache KV |
QueueDepth | Raw | Demandes en attente (file d'attente) |
BatchSize | Raw | Demandes en cours (en cours de vol) |
TPSPerInstance | Regrouper | TPS agrégé par instance |
ConcurrentReqsPerCopy | Raw | Per-copy demandes en vol |
FirstChunkLatencyPerIC | Raw | TTFT par IC |
4XXErrorRatePerIC | Regrouper | Erreurs du client par circuit intégré |
5XXErrorRatePerIC | Regrouper | Erreurs de serveur par circuit intégré |
TTFTPerIC | Raw | TTFT filtré par IC |
ITLPerIC | Raw | ITL filtré par IC |
InputTPSPerIC | Regrouper | Entrée TPS par circuit intégré |
OutputTPSPerIC | Regrouper | Sortie TPS par circuit intégré |
KVCachePerIC | Raw | KV de cache par circuit intégré |
ModelErrorBreakdown | Regrouper | Répartition des erreurs par type |
TTFTet dépendent du framework et ne InterTokenLatency sont pris en charge que pour vLLM et SGlang.
Métriques du GPU (DCGM)
Ces mesures sont collectées à partir de l'exportateur NVIDIA Data Center GPU Manager (DCGM). Ils sont disponibles sur tous les points de terminaison du GPU, quel que soit le framework d'inférence.
| Métrique | Type | Description |
DCGM_FI_DEV_GPU_UTIL | Raw | Utilisation du GPU (%) |
DCGM_FI_DEV_MEM_COPY_UTIL | Raw | Utilisation des copies en mémoire (%) |
DCGM_FI_DEV_GPU_TEMP | Raw | Température du GPU (°C) |
DCGM_FI_DEV_MEMORY_TEMP | Raw | Température de la mémoire (°C) |
DCGM_FI_DEV_FB_FREE | Raw | Mémoire Framebuffer libre (octets) |
DCGM_FI_DEV_FB_USED | Raw | Mémoire Framebuffer utilisée (octets) |
DCGM_FI_DEV_SM_ACTIVE | Raw | Multiprocesseur de streaming actif (%) |
Métriques du nœud (instance)
Ces métriques sont collectées à partir de l'exportateur de nœuds. Ils fournissent une visibilité au niveau de l'instance sur l'utilisation du processeur, de la mémoire et du disque.
| Métrique | Type | Description |
node_cpu_seconds_total | Raw | Temps processeur par mode et par cœur (secondes) |
node_memory_MemTotal_bytes | Raw | Mémoire totale (octets) |
node_memory_MemAvailable_bytes | Raw | Mémoire disponible (octets) |
node_filesystem_size_bytes | Raw | Taille totale du système de fichiers (octets) |
node_filesystem_avail_bytes | Raw | Espace disponible dans le système de fichiers (octets) |
Métriques de placement du HA et du circuit intégré
| Métrique | Type | Description |
ICCopyCountPerAZ | Regrouper | Copies IC par AZ |
ICCopiesPerAZ | Regrouper | Copies IC par AZ (vue alternative) |
AZSkewScore | Regrouper | Score de déséquilibre AZ |
AZBalanceScore | Regrouper | Endpoint-level équilibre |
ICDensityPerAZ | Regrouper | Densité du circuit intégré par AZ |
ICCopiesPerInstance | Regrouper | Copies IC par instance |
ICListPerInstance | Regrouper | Quels circuits intégrés sur quelle instance |
Métriques relatives au cycle de vie et au provisionnement
| Métrique | Type | Description |
ModelDownloadTime | Raw | Il est temps pour Amazon S3 de télécharger l'instance |
GPULoadTime | Raw | Il est temps d'affecter les pondérations à la mémoire du GPU |
ContainerStartDuration | Raw | Début du contrôle de santé du conteneur |
ColdStartDuration | Raw | End-to-end: de la création à la première invocation |
Métriques disponibles uniquement en tant que métriques CloudWatch classiques
Les métriques suivantes sont disponibles uniquement sous forme de métriques CloudWatch classiques (espace de noms et modèle de dimension) et nécessitent un enrichissement OTel pour apparaître sous forme de OpenTelemetry métriques.
| Métrique | Remarques |
InvocationsPerIC | Bloqué contre les OpenTelemetry émissions directes |
InvocationsPerCopy | Bloqué |
ModelLatencyPerIC | Bloqué : à utiliser vllm:e2e_request_latency_seconds comme alternative à l'OTel |
OverheadLatencyPerIC | Bloqué |
MidStreamErrorsPerIC | Bloqué (diffusion bidirectionnelle uniquement) |