View a markdown version of this page

SageMaker Référence des OpenTelemetry métriques d'AI Insights - Amazon CloudWatch

Les traductions sont fournies par des outils de traduction automatique. En cas de conflit entre le contenu d'une traduction et celui de la version originale en anglais, la version anglaise prévaudra.

SageMaker Référence des OpenTelemetry métriques d'AI Insights

Cette section fournit une liste complète des OpenTelemetry métriques émises par l'observabilité détaillée de l' SageMaker IA. L'observabilité détaillée repose sur OpenTelemetry (OTel) et collecte des métriques opérationnelles précises à partir des couches du GPU, des nœuds et du framework d'inférence, puis les publie sous forme de libellés enrichis. CloudWatch

Note

L'observabilité détaillée publie des métriques OpenTelemetry (OTel) CloudWatch via OTLP. Ce ne sont pas des indicateurs de Prometheus. Les métriques sont stockées nativement sous forme de données métriques CloudWatch OTel et peuvent être interrogées à l'aide de la syntaxe ProMQL.

Account-level métriques agrégées

MétriqueTypeDescription
TotalEndpointsRegrouperNombre de points de terminaison du compte
TotalICsRegrouperNombre de tous les composants d'inférence
TotalGPUsRegrouperNombre de tous les GPU (dérivés deDCGM_FI_DEV_GPU_UTIL)

Endpoint-level métriques

MétriqueTypeDescription
InstanceCountPerEndpointRegrouperNombre d'instances desservant le trafic
InstancesPerAZRegrouperInstances par zone de disponibilité
EmptyInstanceCountRegrouperInstances où aucun circuit intégré n'est placé
ScalingActionRawÉvénement de mise à l'échelle (in/out)
ICECountRawNombre d'erreurs liées à une capacité insuffisante
CPUUtilization(EP)RegrouperEndpoint-level Utilisation du processeur
MemoryUtilization(EP)RegrouperEndpoint-level utilisation de la mémoire
DiskUtilization(EP)RegrouperEndpoint-level utilisation du disque
E2EScalingLatencyRawEnd-to-end durée du dimensionnement
RebalancingTypeRawType d'événement de rééquilibrage
RebalancingDurationRawDurée du rééquilibrage (secondes)
RebalancingCopiesMovedRawCopies du circuit intégré déplacées lors du rééquilibrage
AZSkewDeltaRawDéséquilibre de distribution AZ
InstancesReleasedRawInstances libérées par le rééquilibrage

Métriques du cadre d'inférence (VLLm/SGLang)

MétriqueTypeDescription
InputTokensPerSecondRegrouperTaux de jetons d'entrée
OutputTokensPerSecondRegrouperTaux de jetons de sortie
TotalTPSRegrouperTotal de jetons par seconde
TPSUtilizationRegrouperPourcentage d'utilisation du TPS
TTFTRawDélai jusqu'au premier jeton (histogramme)
InterTokenLatencyRawInter-Token Latence (histogramme)
KVCacheUtilizationRawPourcentage d'utilisation du cache KV
QueueDepthRawDemandes en attente (file d'attente)
BatchSizeRawDemandes en cours (en cours de vol)
TPSPerInstanceRegrouperTPS agrégé par instance
ConcurrentReqsPerCopyRawPer-copy demandes en vol
FirstChunkLatencyPerICRawTTFT par IC
4XXErrorRatePerICRegrouperErreurs du client par circuit intégré
5XXErrorRatePerICRegrouperErreurs de serveur par circuit intégré
TTFTPerICRawTTFT filtré par IC
ITLPerICRawITL filtré par IC
InputTPSPerICRegrouperEntrée TPS par circuit intégré
OutputTPSPerICRegrouperSortie TPS par circuit intégré
KVCachePerICRawKV de cache par circuit intégré
ModelErrorBreakdownRegrouperRépartition des erreurs par type
Note

TTFTet dépendent du framework et ne InterTokenLatency sont pris en charge que pour vLLM et SGlang.

Métriques du GPU (DCGM)

Ces mesures sont collectées à partir de l'exportateur NVIDIA Data Center GPU Manager (DCGM). Ils sont disponibles sur tous les points de terminaison du GPU, quel que soit le framework d'inférence.

MétriqueTypeDescription
DCGM_FI_DEV_GPU_UTILRawUtilisation du GPU (%)
DCGM_FI_DEV_MEM_COPY_UTILRawUtilisation des copies en mémoire (%)
DCGM_FI_DEV_GPU_TEMPRawTempérature du GPU (°C)
DCGM_FI_DEV_MEMORY_TEMPRawTempérature de la mémoire (°C)
DCGM_FI_DEV_FB_FREERawMémoire Framebuffer libre (octets)
DCGM_FI_DEV_FB_USEDRawMémoire Framebuffer utilisée (octets)
DCGM_FI_DEV_SM_ACTIVERawMultiprocesseur de streaming actif (%)

Métriques du nœud (instance)

Ces métriques sont collectées à partir de l'exportateur de nœuds. Ils fournissent une visibilité au niveau de l'instance sur l'utilisation du processeur, de la mémoire et du disque.

MétriqueTypeDescription
node_cpu_seconds_totalRawTemps processeur par mode et par cœur (secondes)
node_memory_MemTotal_bytesRawMémoire totale (octets)
node_memory_MemAvailable_bytesRawMémoire disponible (octets)
node_filesystem_size_bytesRawTaille totale du système de fichiers (octets)
node_filesystem_avail_bytesRawEspace disponible dans le système de fichiers (octets)

Métriques de placement du HA et du circuit intégré

MétriqueTypeDescription
ICCopyCountPerAZRegrouperCopies IC par AZ
ICCopiesPerAZRegrouperCopies IC par AZ (vue alternative)
AZSkewScoreRegrouperScore de déséquilibre AZ
AZBalanceScoreRegrouperEndpoint-level équilibre
ICDensityPerAZRegrouperDensité du circuit intégré par AZ
ICCopiesPerInstanceRegrouperCopies IC par instance
ICListPerInstanceRegrouperQuels circuits intégrés sur quelle instance

Métriques relatives au cycle de vie et au provisionnement

MétriqueTypeDescription
ModelDownloadTimeRawIl est temps pour Amazon S3 de télécharger l'instance
GPULoadTimeRawIl est temps d'affecter les pondérations à la mémoire du GPU
ContainerStartDurationRawDébut du contrôle de santé du conteneur
ColdStartDurationRawEnd-to-end: de la création à la première invocation

Métriques disponibles uniquement en tant que métriques CloudWatch classiques

Les métriques suivantes sont disponibles uniquement sous forme de métriques CloudWatch classiques (espace de noms et modèle de dimension) et nécessitent un enrichissement OTel pour apparaître sous forme de OpenTelemetry métriques.

MétriqueRemarques
InvocationsPerICBloqué contre les OpenTelemetry émissions directes
InvocationsPerCopyBloqué
ModelLatencyPerICBloqué : à utiliser vllm:e2e_request_latency_seconds comme alternative à l'OTel
OverheadLatencyPerICBloqué
MidStreamErrorsPerICBloqué (diffusion bidirectionnelle uniquement)