문서 목차
QKS · Monitoring
vLLM 모니터링
Monitoring vLLM 페이지에서 클러스터에서 실행 중인 vLLM 워크로드의 추론 성능 지표를 확인할 수 있습니다.
QUANTUM C&S
개요
Monitoring > vLLM 페이지에서 클러스터에서 실행 중인 vLLM 워크로드의 추론 성능 지표를 확인할 수 있습니다.
vLLM은 대규모 언어 모델(LLM)을 위한 오픈소스 추론 엔진으로, GPU 노드에서 LLM 서빙 워크로드를 실행할 때 사용합니다.
지원 지표
| 지표 | 설명 |
|---|---|
| 초당 요청 수 (RPS) | 초당 처리되는 추론 요청 수 |
| 토큰 처리량 | 초당 생성되는 토큰 수 (tokens/s) |
| Time to First Token (TTFT) | 첫 번째 토큰이 생성되기까지 걸리는 시간 |
| Time Per Output Token (TPOT) | 각 출력 토큰을 생성하는 데 걸리는 시간 |
| 큐 대기 중인 요청 수 | 처리를 기다리는 요청 수 |
| KV Cache 사용률 | KV 캐시 메모리 사용률 (%) |
모델별 지표 확인
vLLM 페이지에서는 클러스터에서 실행 중인 모델별로 지표를 구분하여 확인할 수 있습니다. 여러 모델이 동시에 실행 중인 경우 각 모델의 성능을 개별적으로 모니터링할 수 있습니다.
참고사항
- vLLM 지표는 클러스터에 vLLM 워크로드가 실행 중인 경우에만 표시됩니다.
- vLLM은 반드시 GPU 노드 풀이 있는 클러스터에서 실행해야 합니다.