본문 바로가기
문서 목차
QKS · Monitoring

vLLM 모니터링

Monitoring vLLM 페이지에서 클러스터에서 실행 중인 vLLM 워크로드의 추론 성능 지표를 확인할 수 있습니다.

QUANTUM C&S

개요

Monitoring > vLLM 페이지에서 클러스터에서 실행 중인 vLLM 워크로드의 추론 성능 지표를 확인할 수 있습니다.

vLLM은 대규모 언어 모델(LLM)을 위한 오픈소스 추론 엔진으로, GPU 노드에서 LLM 서빙 워크로드를 실행할 때 사용합니다.


지원 지표

지표 설명
초당 요청 수 (RPS) 초당 처리되는 추론 요청 수
토큰 처리량 초당 생성되는 토큰 수 (tokens/s)
Time to First Token (TTFT) 첫 번째 토큰이 생성되기까지 걸리는 시간
Time Per Output Token (TPOT) 각 출력 토큰을 생성하는 데 걸리는 시간
큐 대기 중인 요청 수 처리를 기다리는 요청 수
KV Cache 사용률 KV 캐시 메모리 사용률 (%)

모델별 지표 확인

vLLM 페이지에서는 클러스터에서 실행 중인 모델별로 지표를 구분하여 확인할 수 있습니다. 여러 모델이 동시에 실행 중인 경우 각 모델의 성능을 개별적으로 모니터링할 수 있습니다.


참고사항

  • vLLM 지표는 클러스터에 vLLM 워크로드가 실행 중인 경우에만 표시됩니다.
  • vLLM은 반드시 GPU 노드 풀이 있는 클러스터에서 실행해야 합니다.