Kubernetes v1.37 릴리즈: 주요 업데이트와 변화
갱 스케줄링 (KEP-4671) — Beta 승격
이번 릴리스의 최대 뉴스입니다. 1.35 Alpha → 1.37 Beta로 승격됐고, Stable 목표는 1.38입니다.
핵심 메커니즘: kube-scheduler가 그룹에 속한 파드들을 식별해 모든 파드가 스케줄링/바인딩 사이클의 같은 단계에 도달할 때까지 대기시키고, 타임아웃 내에 전원이 도달하지 못하면 그룹 전체 스케줄링을 중단하고 모든 리소스를 해제합니다. 이를 위해 Workload라는 새 코어 타입이 도입됐고, 파드 spec에 자신이 속한 Workload에 대한 오브젝트 레퍼런스를 갖습니다. Beta에서 달라진 핵심은 스케줄링 방식 자체인데, Workload Scheduling Cycle이 도입되어 PodGroup에 속한 모든 파드를 기존의 파드 단위 순차 방식이 아니라 한 배치로 일괄 처리하며, 이 파드들은 표준 스케줄링 큐에 개별적으로 들어가지 않습니다. 또 엘라스틱 잡 지원을 위해 PodGroup/PodGroupTemplate의 minCount 필드가 1.37부터 mutable이 됐습니다.
같이 승격된 워크로드 인식 선점(KEP-5710)도 중요합니다. 스케줄러가 저우선순위 워크로드를 선점할 때 개별 파드가 아닌 PodGroup 단위로 판단하게 되어, 갱의 일부만 죽여서 전체를 무력화하는 낭비가 사라집니다.
QKS 관점의 경계선도 명확합니다: KEP-4671의 Non-Goals에 공정성(fairness)이나 멀티 워크로드 큐잉을 kube-scheduler로 가져오는 것은 목표가 아니며 Kueue와 Volcano가 계속 그 역할을 담당한다고 명시되어 있습니다. 즉 코어가 가져가는 건 "이 파드 묶음을 원자적으로 배치하는 메커니즘"까지고, 테넌트 간 쿼터/큐 관리는 여전히 상위 레이어 몫입니다.
DRA — Stable 도달 + 대규모 확장
GPU 인프라 쪽에서 실질적 의미가 큰 변화들입니다:
디바이스 테인트/톨러레이션 (KEP-5055) Stable: 고장나거나 성능 저하된 디바이스를 마킹해 새 워크로드에 할당되지 않게 하는 기능으로, 노드를 격리하듯 디바이스를 드레인할 수 있고, 어떤 드라이버가 관리하는지 같은 기준으로 관리자가 디바이스를 제외 지정할 수도 있습니다. GPU 장애 노드 운영(XID 에러 난 GPU만 빼기)에 바로 쓰이는 기능이죠.
그룹 클레임 공유 (KEP-5729) Beta: 여러 파드가 하나의 리소스 클레임을 공유해 대규모 멀티노드 작업을 돌릴 수 있게 합니다. 갱 스케줄링과 짝을 이루는 기능으로, DRAWorkloadResourceClaims 게이트를 통해 Workload API와 DRA ResourceClaim이 연동됩니다.
네트워크 인터페이스 표준화 (KEP-4817): DRA 드라이버가 연결된 네트워크 인터페이스를 일관된 방식으로 기술할 수 있게 하며, GPU와 RDMA 워크로드에 점점 중요해지는 부분입니다.
CompositePodGroup API (KEP-6012) Alpha: 복잡한 이기종 워크로드의 까다로운 스케줄링 요구사항을 기술하는 방법을 제공합니다. (예: 학습 잡 + 파라미터 서버처럼 구성이 다른 그룹들의 조합)
Watchcache 초기화 복원력 Stable:
API 서버 시작/복구 시 watchcache 초기화가 etcd에 트래픽 스파이크를 만들지 않게 되었고, 비용 큰 list/watch 요청으로 etcd가 과부하되는 대신 한도 내 요청만 위임하고 나머지는 HTTP 429로 거부해 대규모 클러스터의 컨트롤 플레인 장애 위험을 줄입니다. 커스텀 컨트롤러는 Retry-After 헤더를 존중하는 지수 백오프를 구현해야 합니다. Kamaji 호스티드 컨트롤 플레인처럼 컨트롤 플레인을 집적 운영하는 구조에서 체감이 클 부분입니다.
HPA scale-to-zero Beta (기본 활성화):
object/external 메트릭 기반 워크로드에서 유휴 시 0 파드까지 축소했다가 수요가 돌아오면 복원할 수 있어 큐 소비자, 배치 잡, GPU 워크로드 비용을 줄일 수 있습니다. minReplicas: 0으로 적용하며, CPU/메모리 메트릭 기반은 지원되지 않습니다.
kube-proxy 방향 확정:
프록시 모드를 명시하지 않은 클러스터에 폐기 경고가 뜨고(KEP-5343), IPVS 백엔드는 공식 폐기되어 1.40 비활성화, 1.43 제거 로드맵이 잡혔습니다.
이번 v1.37 릴리스는 AI · GPU 워크로드 스케줄링과 디바이스 자원 관리, 대규모 클러스터 운영 안정성 측면에서 의미 있는 변화가 포함됐습니다.
QKS 관점에서도 갱 스케줄링, DRA, HPA scale-to-zero 등 주요 기능의 적용 가능성을 검토할 필요가 있습니다.
Source
Kubernetes Blog · Kubernetes v1.37 Release
2026.08.26.
Kubernetes v1.37 공식 릴리스 노트 보기 →