SageMaker AI Insights OpenTelemetry 지표 참조
이 섹션에서는 SageMaker AI 세부 관찰성에서 내보낸 OpenTelemetry 지표의 포괄적인 목록을 제공합니다. 세부 관찰성은 OpenTelemetry(OTel)를 기반으로 구축되었으며 GPU, 노드 및 추론 프레임워크 계층에서 세분화된 운영 지표를 수집하여 풍부한 레이블을 통해 CloudWatch에 게시합니다.
세부 관찰성은 OTLP를 통해 OpenTelemetry(OTel) 지표를 CloudWatch에 게시합니다. 이는 Prometheus 지표가 아닙니다. 지표는 기본적으로 CloudWatch에 OTel 지표 데이터로 저장되며 PromQL 구문을 사용하여 쿼리할 수 있습니다.
계정 수준 집계 지표
| 지표 | 유형 | 설명 |
TotalEndpoints | Aggregate | 계정의 모든 엔드포인트 수 |
TotalICs | Aggregate | 모든 추론 구성 요소의 수 |
TotalGPUs | Aggregate | 모든 GPU 수(DCGM_FI_DEV_GPU_UTIL에서 파생됨) |
엔드포인트 수준 지표
| 지표 | 유형 | 설명 |
InstanceCountPerEndpoint | Aggregate | 트래픽을 처리하는 인스턴스 수 |
InstancesPerAZ | Aggregate | 가용 영역당 인스턴스 |
EmptyInstanceCount | Aggregate | IC가 배치되지 않은 인스턴스 |
ScalingAction | 원시 | 조정 이벤트(확대/축소) |
ICECount | 원시 | 용량 부족 오류 수 |
CPUUtilization(EP) | Aggregate | 엔드포인트 수준 CPU 사용률 |
MemoryUtilization(EP) | Aggregate | 엔드포인트 수준 메모리 사용률 |
DiskUtilization(EP) | Aggregate | 엔드포인트 수준 디스크 사용률 |
E2EScalingLatency | 원시 | 엔드투엔드 조정 기간 |
RebalancingType | 원시 | 리밸런싱 이벤트 유형 |
RebalancingDuration | 원시 | 리밸런싱 기간(초) |
RebalancingCopiesMoved | 원시 | 리밸런싱 중 이동된 IC 복사본 |
AZSkewDelta | 원시 | AZ 분포 불균형 |
InstancesReleased | 원시 | 리밸런싱을 통해 해제된 인스턴스 |
추론 프레임워크 지표(vLLM/SGLang)
| 지표 | 유형 | 설명 |
InputTokensPerSecond | Aggregate | 입력 토큰 속도 |
OutputTokensPerSecond | Aggregate | 출력 토큰 속도 |
TotalTPS | Aggregate | 초당 총 토큰 수 |
TPSUtilization | Aggregate | TPS 사용률(%) |
TTFT | 원시 | 첫 번째 토큰까지의 시간(히스토그램) |
InterTokenLatency | 원시 | 토큰 간 지연 시간(히스토그램) |
KVCacheUtilization | 원시 | KV 캐시 사용률 |
QueueDepth | 원시 | 대기 요청(대기열) |
BatchSize | 원시 | 요청 실행(진행 중) |
TPSPerInstance | Aggregate | 인스턴스당 집계된 TPS |
ConcurrentReqsPerCopy | 원시 | 복사본당 진행 중인 요청 |
FirstChunkLatencyPerIC | 원시 | IC당 TTFT |
4XXErrorRatePerIC | Aggregate | IC당 클라이언트 오류 |
5XXErrorRatePerIC | Aggregate | IC당 서버 오류 |
TTFTPerIC | 원시 | IC로 필터링된 TTFT |
ITLPerIC | 원시 | IC로 필터링된 ITL |
InputTPSPerIC | Aggregate | IC당 입력 TPS |
OutputTPSPerIC | Aggregate | IC당 출력 TPS |
KVCachePerIC | 원시 | IC당 KV 캐시 |
ModelErrorBreakdown | Aggregate | 유형별 오류 분석 |
TTFT 및 InterTokenLatency는 프레임워크에 따라 다르며 vLLM 및 SGLang에서만 지원됩니다.
GPU(DCGM) 지표
이러한 지표는 NVIDIA DCGM(Data Center GPU Manager) 내보내기에서 수집됩니다. 추론 프레임워크에 관계없이 모든 GPU 엔드포인트에서 사용할 수 있습니다.
| 지표 | 유형 | 설명 |
DCGM_FI_DEV_GPU_UTIL | 원시 | GPU 사용률(%) |
DCGM_FI_DEV_MEM_COPY_UTIL | 원시 | 메모리 복사 사용률(%) |
DCGM_FI_DEV_GPU_TEMP | 원시 | GPU 온도(°C) |
DCGM_FI_DEV_MEMORY_TEMP | 원시 | 메모리 온도(°C) |
DCGM_FI_DEV_FB_FREE | 원시 | Framebuffer 메모리 여유(바이트) |
DCGM_FI_DEV_FB_USED | 원시 | 사용된 Framebuffer 메모리(바이트) |
DCGM_FI_DEV_SM_ACTIVE | 원시 | 스트리밍 멀티프로세서 활성(%) |
노드(인스턴스) 지표
이러한 지표는 노드 내보내기에서 수집됩니다. CPU, 메모리 및 디스크 사용률에 대한 인스턴스 수준의 가시성을 제공합니다.
| 지표 | 유형 | 설명 |
node_cpu_seconds_total | 원시 | 코어별 모드당 CPU 시간(초) |
node_memory_MemTotal_bytes | 원시 | 총 메모리(바이트) |
node_memory_MemAvailable_bytes | 원시 | 사용 가능한 메모리(바이트) |
node_filesystem_size_bytes | 원시 | 파일 시스템 총 크기(바이트) |
node_filesystem_avail_bytes | 원시 | 파일 시스템 사용 가능 공간(바이트) |
HA 및 IC 배치 지표
| 지표 | 유형 | 설명 |
ICCopyCountPerAZ | Aggregate | AZ당 IC 복사본 |
ICCopiesPerAZ | Aggregate | AZ당 IC 복사본(대안 보기) |
AZSkewScore | Aggregate | AZ 불균형 점수 |
AZBalanceScore | Aggregate | 엔드포인트 수준 밸런스 |
ICDensityPerAZ | Aggregate | AZ당 IC 밀도 |
ICCopiesPerInstance | Aggregate | 인스턴스당 IC 복사본 |
ICListPerInstance | Aggregate | 어떤 인스턴스의 어떤 IC |
수명 주기 및 프로비저닝 지표
| 지표 | 유형 | 설명 |
ModelDownloadTime | 원시 | Amazon S3에서 인스턴스로 다운로드하는 시간 |
GPULoadTime | 원시 | GPU 메모리로 가중치 로드 시간 |
ContainerStartDuration | 원시 | 컨테이너 시작부터 상태 확인까지 |
ColdStartDuration | 원시 | 엔드투엔드: 생성부터 첫 번째 호출까지 |
CloudWatch 클래식 지표로만 사용할 수 있는 지표
다음 지표는 CloudWatch 클래식 지표(네임스페이스 및 차원 모델)로만 사용할 수 있으며 OpenTelemetry 지표로 표시되려면 OTel 보강이 필요합니다.
| 지표 | 참고 |
InvocationsPerIC | 직접 OpenTelemetry 내보내기에서 차단됨 |
InvocationsPerCopy | 차단됨 |
ModelLatencyPerIC | 차단됨 - OTel 대안으로 vllm:e2e_request_latency_seconds 사용 |
OverheadLatencyPerIC | 차단됨 |
MidStreamErrorsPerIC | 차단됨(양방향 스트리밍만 해당) |