

Die vorliegende Übersetzung wurde maschinell erstellt. Im Falle eines Konflikts oder eines Widerspruchs zwischen dieser übersetzten Fassung und der englischen Fassung (einschließlich infolge von Verzögerungen bei der Übersetzung) ist die englische Fassung maßgeblich.

# SageMaker Referenz zu KI OpenTelemetry Insights-Metriken
<a name="SageMaker-AI-Insights-Metrics"></a>

Dieser Abschnitt enthält eine umfassende Liste der OpenTelemetry Metriken, die von der detaillierten SageMaker KI-Observability generiert werden. Detailed Observability basiert auf OpenTelemetry (OTel) und sammelt feinkörnige Betriebsmetriken aus den Ebenen GPU, Knoten und Inferenz-Framework und veröffentlicht sie mit ausführlichen Labels. CloudWatch 

**Anmerkung**  
Detailed Observability veröffentlicht OpenTelemetry (oTEL) -Metriken über OTLP. CloudWatch Dies sind keine Prometheus-Metriken. Die Metriken werden nativ CloudWatch als oTEL-Metrikdaten gespeichert und können mithilfe der PromQL-Syntax abgefragt werden.

## Account-level aggregierte Metriken
<a name="SageMaker-AI-Insights-Metrics-account"></a>


| Metrik | Typ | Description | 
| --- | --- | --- | 
| TotalEndpoints | Aggregate | Anzahl aller Endpunkte im Konto | 
| TotalICs | Aggregate | Anzahl aller Inferenzkomponenten | 
| TotalGPUs | Aggregate | Anzahl aller GPUs (abgeleitet von) DCGM\_FI\_DEV\_GPU\_UTIL | 

## Endpoint-level Metriken
<a name="SageMaker-AI-Insights-Metrics-endpoint"></a>


| Metrik | Typ | Description | 
| --- | --- | --- | 
| InstanceCountPerEndpoint | Aggregate | Anzahl der Instanzen, die Traffic bedienen | 
| InstancesPerAZ | Aggregate | Instanzen pro Verfügbarkeitszone | 
| EmptyInstanceCount | Aggregate | Instanzen ohne platzierte ICs | 
| ScalingAction | Raw | Skalierungsereignis (in/out) | 
| ICECount | Raw | Anzahl unzureichender Kapazitätsfehler | 
| CPUUtilization(EP) | Aggregate | Endpoint-level CPU-Auslastung | 
| MemoryUtilization(EP) | Aggregate | Endpoint-level Speichernutzung | 
| DiskUtilization(EP) | Aggregate | Endpoint-level Festplattenauslastung | 
| E2EScalingLatency | Raw | End-to-end Dauer der Skalierung | 
| RebalancingType | Raw | Art des Ausgleichsereignisses | 
| RebalancingDuration | Raw | Dauer des Ausgleichs (Sekunden) | 
| RebalancingCopiesMoved | Raw | IC-Kopien wurden beim Rebalancing verschoben | 
| AZSkewDelta | Raw | Ungleichgewicht bei der AZ-Verteilung | 
| InstancesReleased | Raw | Durch das Rebalancing freigegebene Instanzen | 

## Metriken des Inferenz-Frameworks (vLLM/SGLang)
<a name="SageMaker-AI-Insights-Metrics-framework"></a>


| Metrik | Typ | Description | 
| --- | --- | --- | 
| InputTokensPerSecond | Aggregate | Rate des Eingabe-Tokens | 
| OutputTokensPerSecond | Aggregate | Rate des Ausgangstokens | 
| TotalTPS | Aggregate | Gesamtzahl der Tokens pro Sekunde | 
| TPSUtilization | Aggregate | Prozentsatz der TPS-Auslastung | 
| TTFT | Raw | Zeit bis zum ersten Token (Histogramm) | 
| InterTokenLatency | Raw | Inter-Token Latenz (Histogramm) | 
| KVCacheUtilization | Raw | Prozentsatz der KV-Cache-Nutzung | 
| QueueDepth | Raw | Wartende Anfragen (Warteschlange) | 
| BatchSize | Raw | Laufende Anfragen (während des Fluges) | 
| TPSPerInstance | Aggregate | TPS, aggregiert pro Instanz | 
| ConcurrentReqsPerCopy | Raw | Per-copy Anfragen während des Fluges | 
| FirstChunkLatencyPerIC | Raw | TTFT pro IC | 
| 4XXErrorRatePerIC | Aggregate | Client-Fehler pro IC | 
| 5XXErrorRatePerIC | Aggregate | Serverfehler pro IC | 
| TTFTPerIC | Raw | Von IC gefiltertes TTFT | 
| ITLPerIC | Raw | ITL gefiltert nach IC | 
| InputTPSPerIC | Aggregate | Geben Sie TPS pro IC ein | 
| OutputTPSPerIC | Aggregate | Ausgang TPS pro IC | 
| KVCachePerIC | Raw | KV-Cache pro IC | 
| ModelErrorBreakdown | Aggregate | Aufschlüsselung der Fehler nach Typ | 

**Anmerkung**  
`TTFT`und `InterTokenLatency` sind vom Framework abhängig und werden nur für vLLM und SGLang unterstützt.

## GPU-Metriken (DCGM)
<a name="SageMaker-AI-Insights-Metrics-gpu"></a>

Diese Metriken werden vom NVIDIA Data Center GPU Manager (DCGM) -Exporter erfasst. Sie sind auf allen GPU-Endpunkten verfügbar, unabhängig vom Inferenz-Framework.


| Metrik | Typ | Description | 
| --- | --- | --- | 
| DCGM\_FI\_DEV\_GPU\_UTIL | Raw | GPU-Auslastung (%) | 
| DCGM\_FI\_DEV\_MEM\_COPY\_UTIL | Raw | Auslastung von Speicherkopien (%) | 
| DCGM\_FI\_DEV\_GPU\_TEMP | Raw | GPU-Temperatur (°C) | 
| DCGM\_FI\_DEV\_MEMORY\_TEMP | Raw | Speichertemperatur (°C) | 
| DCGM\_FI\_DEV\_FB\_FREE | Raw | Freier Framebuffer-Speicher (Byte) | 
| DCGM\_FI\_DEV\_FB\_USED | Raw | Verwendeter Framebuffer-Speicher (Byte) | 
| DCGM\_FI\_DEV\_SM\_ACTIVE | Raw | Streaming-Multiprozessor aktiv (%) | 

## Metriken für Knoten (Instanz)
<a name="SageMaker-AI-Insights-Metrics-node"></a>

Diese Metriken werden vom Node Exporter gesammelt. Sie bieten Einblick in die CPU-, Arbeitsspeicher- und Festplattenauslastung auf Instanzebene.


| Metrik | Typ | Description | 
| --- | --- | --- | 
| node\_cpu\_seconds\_total | Raw | CPU-Zeit pro Modus pro Kern (Sekunden) | 
| node\_memory\_MemTotal\_bytes | Raw | Gesamtspeicher (Byte) | 
| node\_memory\_MemAvailable\_bytes | Raw | Verfügbarer Speicher (Byte) | 
| node\_filesystem\_size\_bytes | Raw | Gesamtgröße des Dateisystems (Byte) | 
| node\_filesystem\_avail\_bytes | Raw | Verfügbarer Speicherplatz im Dateisystem (Byte) | 

## Kennzahlen zur HA- und IC-Platzierung
<a name="SageMaker-AI-Insights-Metrics-ha"></a>


| Metrik | Typ | Description | 
| --- | --- | --- | 
| ICCopyCountPerAZ | Aggregate | IC-Kopien pro AZ | 
| ICCopiesPerAZ | Aggregate | IC-Kopien pro AZ (alternative Ansicht) | 
| AZSkewScore | Aggregate | AZ-Ungleichgewichtswert | 
| AZBalanceScore | Aggregate | Endpoint-level Gleichgewicht | 
| ICDensityPerAZ | Aggregate | IC-Dichte pro AZ | 
| ICCopiesPerInstance | Aggregate | IC-Kopien pro Instanz | 
| ICListPerInstance | Aggregate | Welche ICs auf welcher Instanz | 

## Metriken zum Lebenszyklus und zur Bereitstellung
<a name="SageMaker-AI-Insights-Metrics-lifecycle"></a>


| Metrik | Typ | Description | 
| --- | --- | --- | 
| ModelDownloadTime | Raw | Zeit für den Instanz-Download von Amazon S3 | 
| GPULoadTime | Raw | Zeit für Gewichtungen im GPU-Speicher | 
| ContainerStartDuration | Raw | Beginn der Integritätsprüfung des Containers | 
| ColdStartDuration | Raw | End-to-end: Erstellung bis zum ersten Aufruf | 

## Metriken sind nur als CloudWatch klassische Metriken verfügbar
<a name="SageMaker-AI-Insights-Metrics-classic"></a>

Die folgenden Metriken sind nur als CloudWatch klassische Metriken (Namespace und Dimensionsmodell) verfügbar und erfordern eine oTEL-Anreicherung, um als OpenTelemetry Metriken angezeigt zu werden.


| Metrik | Hinweise | 
| --- | --- | 
| InvocationsPerIC | Gegen direkte Emission gesperrt OpenTelemetry  | 
| InvocationsPerCopy | Blocked | 
| ModelLatencyPerIC | Blockiert — vllm:e2e\_request\_latency\_seconds als oTEL-Alternative verwenden | 
| OverheadLatencyPerIC | Blocked | 
| MidStreamErrorsPerIC | Blockiert (nur bidirektionales Streaming) | 