문서 목차
QKS · Monitoring
GPU & AI 모니터링
Monitoring GPU & AI 페이지에서 GPU 노드의 실시간 사용 현황과 AI/ML 워크로드 성능 지표를 확인할 수 있습니다. NVIDIA DCGM(Data Center GPU Manager) Exporter를 통해 GPU별 상세 메트릭을 수집합니다.
QUANTUM C&S
개요
Monitoring > GPU & AI 페이지에서 GPU 노드의 실시간 사용 현황과 AI/ML 워크로드 성능 지표를 확인할 수 있습니다. NVIDIA DCGM(Data Center GPU Manager) Exporter를 통해 GPU별 상세 메트릭을 수집합니다.
GPU 지표
성능 지표
| 지표 | 단위 | 설명 |
|---|---|---|
| GPU 사용률 | % | GPU 컴퓨팅 코어 사용률. 0%는 유휴 상태, 100%는 완전 활용 상태 |
| GPU 메모리 사용률 | % | GPU VRAM 사용률 |
| GPU 메모리 사용량 | GiB | 현재 사용 중인 GPU 메모리의 절대 크기 |
| 토큰 처리량 | tokens/s | vLLM 등 LLM 워크로드의 초당 처리 토큰 수 |
하드웨어 상태 지표
| 지표 | 단위 | 설명 |
|---|---|---|
| GPU 온도 | °C | GPU 다이 온도. 일반적으로 80°C 이하 권장 |
| 전력 소비 | W | 현재 GPU 전력 소비량 |
| 전력 한도 | W | GPU의 최대 전력 한도(TDP) |
| 팬 속도 | % | GPU 냉각 팬 속도 |
노드별 GPU 현황
GPU 노드 목록에서 각 노드에 탑재된 GPU의 전체 현황을 한눈에 확인할 수 있습니다.
- GPU 모델: 탑재된 GPU 종류 (예: NVIDIA A100, H100, RTX 4090)
- GPU 수: 노드당 탑재된 GPU 수
- 할당 상태: 현재 파드에 할당된 GPU 수 / 전체 GPU 수
GPU 할당 현황 확인
# 노드별 GPU 용량 및 할당 가능량 확인
kubectl get nodes -o custom-columns=\
"NAME:.metadata.name,\
GPU_CAPACITY:.status.capacity.nvidia\.com/gpu,\
GPU_ALLOCATABLE:.status.allocatable.nvidia\.com/gpu"
# GPU를 요청 중인 파드 확인
kubectl get pods -A -o json | \
jq '.items[] | select(.spec.containers[].resources.requests["nvidia.com/gpu"] != null) |
{namespace: .metadata.namespace, name: .metadata.name, gpu: .spec.containers[].resources.requests["nvidia.com/gpu"]}'
GPU 사용 워크로드 배포
GPU 노드 풀에 워크로드를 배포하려면 Pod 스펙에 GPU 리소스 요청을 추가합니다.
spec:
containers:
- name: my-gpu-app
image: my-ai-app:latest
resources:
limits:
nvidia.com/gpu: 1 # GPU 1개 요청
GPU 리소스는 requests가 아닌 limits에만 지정합니다. 정수 값만 지원하며 소수점 GPU 할당은 지원하지 않습니다.
GPU 알림 기준 가이드
| 지표 | 주의 기준 | 위험 기준 |
|---|---|---|
| GPU 온도 | 80°C 초과 | 90°C 초과 |
| GPU 메모리 사용률 | 85% 초과 | 95% 초과 |
| 전력 소비 | TDP의 90% 초과 | TDP의 100% |