본문 바로가기
문서 목차
QKS · Monitoring

GPU & AI 모니터링

Monitoring GPU & AI 페이지에서 GPU 노드의 실시간 사용 현황과 AI/ML 워크로드 성능 지표를 확인할 수 있습니다. NVIDIA DCGM(Data Center GPU Manager) Exporter를 통해 GPU별 상세 메트릭을 수집합니다.

QUANTUM C&S

개요

Monitoring > GPU & AI 페이지에서 GPU 노드의 실시간 사용 현황과 AI/ML 워크로드 성능 지표를 확인할 수 있습니다. NVIDIA DCGM(Data Center GPU Manager) Exporter를 통해 GPU별 상세 메트릭을 수집합니다.


GPU 지표

성능 지표

지표 단위 설명
GPU 사용률 % GPU 컴퓨팅 코어 사용률. 0%는 유휴 상태, 100%는 완전 활용 상태
GPU 메모리 사용률 % GPU VRAM 사용률
GPU 메모리 사용량 GiB 현재 사용 중인 GPU 메모리의 절대 크기
토큰 처리량 tokens/s vLLM 등 LLM 워크로드의 초당 처리 토큰 수

하드웨어 상태 지표

지표 단위 설명
GPU 온도 °C GPU 다이 온도. 일반적으로 80°C 이하 권장
전력 소비 W 현재 GPU 전력 소비량
전력 한도 W GPU의 최대 전력 한도(TDP)
팬 속도 % GPU 냉각 팬 속도

노드별 GPU 현황

GPU 노드 목록에서 각 노드에 탑재된 GPU의 전체 현황을 한눈에 확인할 수 있습니다.

  • GPU 모델: 탑재된 GPU 종류 (예: NVIDIA A100, H100, RTX 4090)
  • GPU 수: 노드당 탑재된 GPU 수
  • 할당 상태: 현재 파드에 할당된 GPU 수 / 전체 GPU 수

GPU 할당 현황 확인

# 노드별 GPU 용량 및 할당 가능량 확인
kubectl get nodes -o custom-columns=\
"NAME:.metadata.name,\
GPU_CAPACITY:.status.capacity.nvidia\.com/gpu,\
GPU_ALLOCATABLE:.status.allocatable.nvidia\.com/gpu"

# GPU를 요청 중인 파드 확인
kubectl get pods -A -o json | \
  jq '.items[] | select(.spec.containers[].resources.requests["nvidia.com/gpu"] != null) |
  {namespace: .metadata.namespace, name: .metadata.name, gpu: .spec.containers[].resources.requests["nvidia.com/gpu"]}'

GPU 사용 워크로드 배포

GPU 노드 풀에 워크로드를 배포하려면 Pod 스펙에 GPU 리소스 요청을 추가합니다.

spec:
  containers:
    - name: my-gpu-app
      image: my-ai-app:latest
      resources:
        limits:
          nvidia.com/gpu: 1  # GPU 1개 요청

GPU 리소스는 requests가 아닌 limits에만 지정합니다. 정수 값만 지원하며 소수점 GPU 할당은 지원하지 않습니다.


GPU 알림 기준 가이드

지표 주의 기준 위험 기준
GPU 온도 80°C 초과 90°C 초과
GPU 메모리 사용률 85% 초과 95% 초과
전력 소비 TDP의 90% 초과 TDP의 100%

관련 항목

  • vLLM 모니터링 — LLM 추론 워크로드의 상세 성능 지표를 확인하세요.
  • Alerts — GPU 이상 상황에 대한 알림을 설정하세요.
GPU & AI 모니터링 | QUANTUM C&S