문서 목차
핵심 개념
노드 수를 늘리거나 줄입니다. Scale in 시 파드가 다른 노드로 이동합니다.
QUANTUM C&S
QKS에서 사용하는 주요 용어와 개념을 정리합니다. 여기서 설명하는 개념들은 다른 문서 전반에 걸쳐 반복적으로 등장합니다.
클러스터
클러스터는 QKS가 프로비저닝하고 운영하는 완전 관리형 Kubernetes 환경입니다. 각 클러스터는 QKS가 관리하는 컨트롤 플레인과, 사용자의 워크로드가 실행되는 워커 노드로 구성됩니다.
클러스터를 생성하면 컨트롤 플레인 구성요소(API 서버, etcd, 스케줄러, 컨트롤러 매니저)가 자동으로 설치됩니다. 사용자는 컨트롤 플레인을 직접 관리할 필요가 없습니다.
클러스터 상태 흐름:
requested → provisioning → bootstrapping → running
↕ degraded
→ upgrading → running
→ deleting
→ failed
| 상태 | 설명 |
|---|---|
requested |
생성 요청 접수 |
provisioning |
컨트롤 플레인 및 노드 VM 생성 중 |
bootstrapping |
K8s 컴포넌트 설치 및 초기화 중 |
running |
정상 동작 중 |
upgrading |
K8s 버전 업그레이드 진행 중 |
degraded |
구성 요소 이상 감지, 확인 필요 |
deleting |
삭제 진행 중 |
failed |
작업 실패 (재시도 가능) |
컨트롤 플레인
Kubernetes 클러스터의 상태를 관리하는 구성 요소 집합입니다. API 서버, etcd, 스케줄러, 컨트롤러 매니저가 포함됩니다.
QKS는 멀티테넌트 컨트롤 플레인 엔진을 기반으로 각 클러스터의 컨트롤 플레인을 독립적으로 격리 운영합니다. 사용자는 컨트롤 플레인의 존재를 의식하지 않아도 됩니다.
노드 풀
동일한 하드웨어 사양(CPU, 메모리, 디스크, GPU)을 공유하는 워커 노드의 그룹입니다. 하나의 클러스터에 여러 노드 풀을 구성할 수 있습니다.
노드 풀의 주요 작업:
스케일
노드 수를 늘리거나 줄입니다. Scale-in 시 파드가 다른 노드로 이동합니다.
오토스케일링
최소/최대 노드 수 범위 내에서 워크로드에 따라 자동으로 노드 수를 조정합니다.
리사이즈
노드의 CPU 또는 메모리 사양을 변경합니다. 기존 노드를 순차적으로 교체합니다.
삭제
노드 풀을 제거합니다. 클러스터의 마지막 노드 풀은 삭제할 수 없습니다.
GPU 노드 풀
NVIDIA GPU가 탑재된 노드 풀입니다. GPU 노드에는 NVIDIA Device Plugin과 DCGM Exporter가 자동으로 설치됩니다.
지원 GPU 타입:
| 타입 | vCPU | 메모리 | 특성 |
|---|---|---|---|
L40S |
16 | 64 GiB | NVIDIA L40S 풀사이즈, 대형 추론/학습 |
HPC_GPU |
32 | 128 GiB | 엔터프라이즈 HPC GPU |
MIG_1g |
4 | 16 GiB | MIG 1 슬라이스, 소규모 추론 |
MIG_2g |
8 | 32 GiB | MIG 2 슬라이스 |
MIG_3g |
12 | 48 GiB | MIG 3 슬라이스 |
Pod에서 GPU를 요청하려면 limits에 nvidia.com/gpu: 1을 지정합니다.
Cluster Mesh
두 개 이상의 QKS 클러스터를 L3 네트워크 수준에서 연결하는 기능입니다. Cilium Cluster Mesh 기반으로 동작하며, 연결된 클러스터 간에 파드와 Service가 직접 통신할 수 있습니다.
연결 요청(Mesh Request)은 다음 흐름으로 진행됩니다:
Pending → Approved → Connecting → Connected
↘ Rejected
Cancelling → Cancelled
Connected → Disconnecting → Disconnected
Failed (연결 실패)
연결에 필요한 조건: 두 클러스터의 Pod CIDR과 Service CIDR이 겹치지 않아야 합니다.
Operation
클러스터 생성, 업그레이드, 노드 풀 스케일 등 시간이 걸리는 작업은 비동기 Operation으로 처리됩니다. Operations 페이지에서 단계별 진행 상황과 결과를 확인할 수 있습니다.
Operation 상태: pending → running → succeeded / failed / timeout
| 작업 유형 | 설명 |
|---|---|
create_cluster |
새 클러스터 생성 |
upgrade_cluster |
K8s 버전 업그레이드 |
scale_node_pool |
노드 풀 스케일 |
resize_node_pool |
노드 풀 사양 변경 |
repair_cluster |
클러스터 복구 |
kubeconfig
클러스터 API 서버 주소, 인증 토큰, TLS 인증서를 담은 자격증명 파일입니다. kubectl 또는 Lens, k9s 같은 도구와 함께 사용합니다. 클러스터 상세 페이지에서 다운로드할 수 있습니다.
Velero 백업
Velero를 통해 클러스터 리소스와 PVC 스냅샷을 오브젝트 스토리지에 저장합니다. 테넌트별로 분리된 버킷 프리픽스를 사용합니다.
클러스터 생성 시 velero: enabled: true를 선택하면 활성화되며, 크론 표현식으로 예약 백업 주기를 설정할 수 있습니다.
멤버 역할
클러스터별로 사용자에게 역할을 부여합니다.
| 역할 | 허용 작업 |
|---|---|
owner |
클러스터 삭제, 멤버 관리 포함 전체 권한 |
editor |
워크로드 배포, VM 수명주기, 네임스페이스 생성 |
viewer |
읽기 전용 |