View a markdown version of this page

SageMaker Riferimento alle OpenTelemetry metriche di AI Insights - Amazon CloudWatch

Le traduzioni sono generate tramite traduzione automatica. In caso di conflitto tra il contenuto di una traduzione e la versione originale in Inglese, quest'ultima prevarrà.

SageMaker Riferimento alle OpenTelemetry metriche di AI Insights

Questa sezione fornisce un elenco completo delle OpenTelemetry metriche emesse dall'osservabilità dettagliata dell'IA. SageMaker L'osservabilità dettagliata è basata su OpenTelemetry (OtEL) e raccoglie metriche operative granulari dai livelli di GPU, nodo e framework di inferenza, pubblicandole con etichette complete. CloudWatch

Nota

L'osservabilità dettagliata pubblica le metriche (OtEL) tramite OTLP. OpenTelemetry CloudWatch Queste non sono metriche di Prometheus. Le metriche sono archiviate nativamente CloudWatch come dati metrici OTel e possono essere interrogate utilizzando la sintassi PromQL.

Account-level metriche aggregate

MetricaTipoDescription
TotalEndpointsAggregazioneConteggio di tutti gli endpoint dell'account
TotalICsAggregazioneConteggio di tutti i componenti di inferenza
TotalGPUsAggregazioneNumero di tutte le GPU (derivate da) DCGM_FI_DEV_GPU_UTIL

Endpoint-level metriche

MetricaTipoDescription
InstanceCountPerEndpointAggregazioneNumero di istanze che servono il traffico
InstancesPerAZAggregazioneIstanze per zona di disponibilità
EmptyInstanceCountAggregazioneIstanze senza IC posizionati
ScalingActionRawEvento di scalabilità () in/out
ICECountRawNumero di errori di capacità insufficiente
CPUUtilization(EP)AggregazioneEndpoint-level Utilizzo della CPU
MemoryUtilization(EP)AggregazioneEndpoint-level utilizzo della memoria
DiskUtilization(EP)AggregazioneEndpoint-level utilizzo del disco
E2EScalingLatencyRawEnd-to-end durata del ridimensionamento
RebalancingTypeRawTipo di evento di ribilanciamento
RebalancingDurationRawDurata del ribilanciamento (secondi)
RebalancingCopiesMovedRawCopie IC spostate durante il ribilanciamento
AZSkewDeltaRawSquilibrio di distribuzione AZ
InstancesReleasedRawIstanze liberate mediante ribilanciamento

Metriche del framework di inferenza (vLLM/SGlang)

MetricaTipoDescription
InputTokensPerSecondAggregazioneFrequenza del token di input
OutputTokensPerSecondAggregazioneFrequenza del token di output
TotalTPSAggregazioneToken totali al secondo
TPSUtilizationAggregazionePercentuale di utilizzo del TPS
TTFTRawTime to First Token (istogramma)
InterTokenLatencyRawInter-Token Latenza (istogramma)
KVCacheUtilizationRawPercentuale di utilizzo della cache KV
QueueDepthRawRichieste in attesa (coda)
BatchSizeRawRichieste in corso (in volo)
TPSPerInstanceAggregazioneTPS aggregato per istanza
ConcurrentReqsPerCopyRawPer-copy richieste in volo
FirstChunkLatencyPerICRawTTFT per IC
4XXErrorRatePerICAggregazioneErrori del client per IC
5XXErrorRatePerICAggregazioneErrori del server per IC
TTFTPerICRawTTFT filtrato da IC
ITLPerICRawITL filtrato da IC
InputTPSPerICAggregazioneIngresso TPS per IC
OutputTPSPerICAggregazioneUscita TPS per IC
KVCachePerICRawCache KV per IC
ModelErrorBreakdownAggregazioneSuddivisione degli errori per tipo
Nota

TTFTe dipendono dal framework e InterTokenLatency sono supportati solo per VLLm e sgLang.

Metriche GPU (DCGM)

Queste metriche vengono raccolte dall'esportatore NVIDIA Data Center GPU Manager (DCGM). Sono disponibili su tutti gli endpoint GPU indipendentemente dal framework di inferenza.

MetricaTipoDescription
DCGM_FI_DEV_GPU_UTILRawUtilizzo della GPU (%)
DCGM_FI_DEV_MEM_COPY_UTILRawUtilizzo della copia di memoria (%)
DCGM_FI_DEV_GPU_TEMPRawTemperatura della GPU (°C)
DCGM_FI_DEV_MEMORY_TEMPRawTemperatura della memoria (°C)
DCGM_FI_DEV_FB_FREERawMemoria framebuffer libera (byte)
DCGM_FI_DEV_FB_USEDRawMemoria framebuffer utilizzata (byte)
DCGM_FI_DEV_SM_ACTIVERawStreaming multiprocessore attivo (%)

Metriche relative ai nodi (istanze)

Queste metriche vengono raccolte dall'esportatore del nodo. Forniscono visibilità a livello di istanza sull'utilizzo di CPU, memoria e disco.

MetricaTipoDescription
node_cpu_seconds_totalRawTempo di CPU per modalità per core (secondi)
node_memory_MemTotal_bytesRawMemoria totale (byte)
node_memory_MemAvailable_bytesRawMemoria disponibile (byte)
node_filesystem_size_bytesRawDimensione totale del file system (byte)
node_filesystem_avail_bytesRawSpazio disponibile nel file system (byte)

Metriche di posizionamento HA e IC

MetricaTipoDescription
ICCopyCountPerAZAggregazioneCopie IC per AZ
ICCopiesPerAZAggregazioneCopie IC per AZ (visualizzazione alternativa)
AZSkewScoreAggregazionePunteggio di squilibrio AZ
AZBalanceScoreAggregazioneEndpoint-level equilibrio
ICDensityPerAZAggregazionedensità IC per AZ
ICCopiesPerInstanceAggregazioneCopie IC per istanza
ICListPerInstanceAggregazioneQuali IC su quale istanza

Metriche relative al ciclo di vita e al provisioning

MetricaTipoDescription
ModelDownloadTimeRawÈ ora di scaricare l'istanza da Amazon S3
GPULoadTimeRawTempo di calcolo dei pesi sulla memoria della GPU
ContainerStartDurationRawInizia il controllo dello stato del contenitore
ColdStartDurationRawEnd-to-end: dalla creazione alla prima invocazione

Metriche disponibili solo come metriche classiche CloudWatch

Le seguenti metriche sono disponibili solo come metriche CloudWatch classiche (namespace e modello dimensionale) e richiedono l'arricchimento di Otel per apparire come metriche. OpenTelemetry

MetricaNote
InvocationsPerICBloccato dall'emissione diretta OpenTelemetry
InvocationsPerCopyBloccato
ModelLatencyPerICBloccato: da utilizzare vllm:e2e_request_latency_seconds come alternativa all'OtL
OverheadLatencyPerICBloccato
MidStreamErrorsPerICBloccato (solo streaming bidirezionale)