View a markdown version of this page

SageMaker Referenz zu KI OpenTelemetry Insights-Metriken - Amazon CloudWatch

Die vorliegende Übersetzung wurde maschinell erstellt. Im Falle eines Konflikts oder eines Widerspruchs zwischen dieser übersetzten Fassung und der englischen Fassung (einschließlich infolge von Verzögerungen bei der Übersetzung) ist die englische Fassung maßgeblich.

SageMaker Referenz zu KI OpenTelemetry Insights-Metriken

Dieser Abschnitt enthält eine umfassende Liste der OpenTelemetry Metriken, die von der detaillierten SageMaker KI-Observability generiert werden. Detailed Observability basiert auf OpenTelemetry (OTel) und sammelt feinkörnige Betriebsmetriken aus den Ebenen GPU, Knoten und Inferenz-Framework und veröffentlicht sie mit ausführlichen Labels. CloudWatch

Anmerkung

Detailed Observability veröffentlicht OpenTelemetry (oTEL) -Metriken über OTLP. CloudWatch Dies sind keine Prometheus-Metriken. Die Metriken werden nativ CloudWatch als oTEL-Metrikdaten gespeichert und können mithilfe der PromQL-Syntax abgefragt werden.

Account-level aggregierte Metriken

MetrikTypDescription
TotalEndpointsAggregateAnzahl aller Endpunkte im Konto
TotalICsAggregateAnzahl aller Inferenzkomponenten
TotalGPUsAggregateAnzahl aller GPUs (abgeleitet von) DCGM_FI_DEV_GPU_UTIL

Endpoint-level Metriken

MetrikTypDescription
InstanceCountPerEndpointAggregateAnzahl der Instanzen, die Traffic bedienen
InstancesPerAZAggregateInstanzen pro Verfügbarkeitszone
EmptyInstanceCountAggregateInstanzen ohne platzierte ICs
ScalingActionRawSkalierungsereignis (in/out)
ICECountRawAnzahl unzureichender Kapazitätsfehler
CPUUtilization(EP)AggregateEndpoint-level CPU-Auslastung
MemoryUtilization(EP)AggregateEndpoint-level Speichernutzung
DiskUtilization(EP)AggregateEndpoint-level Festplattenauslastung
E2EScalingLatencyRawEnd-to-end Dauer der Skalierung
RebalancingTypeRawArt des Ausgleichsereignisses
RebalancingDurationRawDauer des Ausgleichs (Sekunden)
RebalancingCopiesMovedRawIC-Kopien wurden beim Rebalancing verschoben
AZSkewDeltaRawUngleichgewicht bei der AZ-Verteilung
InstancesReleasedRawDurch das Rebalancing freigegebene Instanzen

Metriken des Inferenz-Frameworks (vLLM/SGLang)

MetrikTypDescription
InputTokensPerSecondAggregateRate des Eingabe-Tokens
OutputTokensPerSecondAggregateRate des Ausgangstokens
TotalTPSAggregateGesamtzahl der Tokens pro Sekunde
TPSUtilizationAggregateProzentsatz der TPS-Auslastung
TTFTRawZeit bis zum ersten Token (Histogramm)
InterTokenLatencyRawInter-Token Latenz (Histogramm)
KVCacheUtilizationRawProzentsatz der KV-Cache-Nutzung
QueueDepthRawWartende Anfragen (Warteschlange)
BatchSizeRawLaufende Anfragen (während des Fluges)
TPSPerInstanceAggregateTPS, aggregiert pro Instanz
ConcurrentReqsPerCopyRawPer-copy Anfragen während des Fluges
FirstChunkLatencyPerICRawTTFT pro IC
4XXErrorRatePerICAggregateClient-Fehler pro IC
5XXErrorRatePerICAggregateServerfehler pro IC
TTFTPerICRawVon IC gefiltertes TTFT
ITLPerICRawITL gefiltert nach IC
InputTPSPerICAggregateGeben Sie TPS pro IC ein
OutputTPSPerICAggregateAusgang TPS pro IC
KVCachePerICRawKV-Cache pro IC
ModelErrorBreakdownAggregateAufschlüsselung der Fehler nach Typ
Anmerkung

TTFTund InterTokenLatency sind vom Framework abhängig und werden nur für vLLM und SGLang unterstützt.

GPU-Metriken (DCGM)

Diese Metriken werden vom NVIDIA Data Center GPU Manager (DCGM) -Exporter erfasst. Sie sind auf allen GPU-Endpunkten verfügbar, unabhängig vom Inferenz-Framework.

MetrikTypDescription
DCGM_FI_DEV_GPU_UTILRawGPU-Auslastung (%)
DCGM_FI_DEV_MEM_COPY_UTILRawAuslastung von Speicherkopien (%)
DCGM_FI_DEV_GPU_TEMPRawGPU-Temperatur (°C)
DCGM_FI_DEV_MEMORY_TEMPRawSpeichertemperatur (°C)
DCGM_FI_DEV_FB_FREERawFreier Framebuffer-Speicher (Byte)
DCGM_FI_DEV_FB_USEDRawVerwendeter Framebuffer-Speicher (Byte)
DCGM_FI_DEV_SM_ACTIVERawStreaming-Multiprozessor aktiv (%)

Metriken für Knoten (Instanz)

Diese Metriken werden vom Node Exporter gesammelt. Sie bieten Einblick in die CPU-, Arbeitsspeicher- und Festplattenauslastung auf Instanzebene.

MetrikTypDescription
node_cpu_seconds_totalRawCPU-Zeit pro Modus pro Kern (Sekunden)
node_memory_MemTotal_bytesRawGesamtspeicher (Byte)
node_memory_MemAvailable_bytesRawVerfügbarer Speicher (Byte)
node_filesystem_size_bytesRawGesamtgröße des Dateisystems (Byte)
node_filesystem_avail_bytesRawVerfügbarer Speicherplatz im Dateisystem (Byte)

Kennzahlen zur HA- und IC-Platzierung

MetrikTypDescription
ICCopyCountPerAZAggregateIC-Kopien pro AZ
ICCopiesPerAZAggregateIC-Kopien pro AZ (alternative Ansicht)
AZSkewScoreAggregateAZ-Ungleichgewichtswert
AZBalanceScoreAggregateEndpoint-level Gleichgewicht
ICDensityPerAZAggregateIC-Dichte pro AZ
ICCopiesPerInstanceAggregateIC-Kopien pro Instanz
ICListPerInstanceAggregateWelche ICs auf welcher Instanz

Metriken zum Lebenszyklus und zur Bereitstellung

MetrikTypDescription
ModelDownloadTimeRawZeit für den Instanz-Download von Amazon S3
GPULoadTimeRawZeit für Gewichtungen im GPU-Speicher
ContainerStartDurationRawBeginn der Integritätsprüfung des Containers
ColdStartDurationRawEnd-to-end: Erstellung bis zum ersten Aufruf

Metriken sind nur als CloudWatch klassische Metriken verfügbar

Die folgenden Metriken sind nur als CloudWatch klassische Metriken (Namespace und Dimensionsmodell) verfügbar und erfordern eine oTEL-Anreicherung, um als OpenTelemetry Metriken angezeigt zu werden.

MetrikHinweise
InvocationsPerICGegen direkte Emission gesperrt OpenTelemetry
InvocationsPerCopyBlocked
ModelLatencyPerICBlockiert — vllm:e2e_request_latency_seconds als oTEL-Alternative verwenden
OverheadLatencyPerICBlocked
MidStreamErrorsPerICBlockiert (nur bidirektionales Streaming)