문서 목차
Pipeline Ops · 데이터 품질
Spark 작업, 스트리밍 커넥터, 데이터 품질 판정, 스케줄 작업의 상태를 한 화면에서 확인합니다
QUANTUM C&S
Pipeline Ops 는 "데이터가 지금도 정상적으로 흐르고 있는가"를 판단하는 운영 화면입니다. 조용히 멈춘 파이프라인을 화면을 열지 않고도 알 수 있도록 판정과 알림까지 연결되어 있습니다.
화면 구성
┌─────────────────────────────────────────────────────────┐
│ Spark Applications │
├─────────────────────────────────────────────────────────┤
│ 스트리밍 (CDC / Kafka Connect) │
├─────────────────────────────────────────────────────────┤
│ Data Quality │
├─────────────────────────────────────────────────────────┤
│ 미등록 장비 데이터 유입 │
├─────────────────────────────────────────────────────────┤
│ CronJobs │
└─────────────────────────────────────────────────────────┘
Spark Applications
스트리밍 적재와 배치 가공을 수행하는 Spark 작업의 상태입니다. 실행 중 · 완료 · 실패 개수를 요약하고 작업별 상태를 나열합니다.
스트리밍 작업이 예상과 달리 종료 상태라면 데이터 유입이 멈춘 것이므로, 아래 Data Quality 패널의 신선도 판정과 함께 확인합니다.
스트리밍 (CDC / Kafka Connect)
원천 DB의 변경을 읽는 소스 커넥터와, 레이크하우스에 쓰는 sink 커넥터의 상태입니다. 관측 전용이며 이 화면에서 커넥터를 변경하지 않습니다.
| 지표 | 의미 |
|---|---|
| Total | 등록된 커넥터 수 |
| Running | 정상 동작 |
| Paused | 일시 정지 |
| Failed | 실패 |
| 컬럼 | 의미 |
|---|---|
| 커넥터 | 커넥터 이름 |
| State | 커넥터 상태 |
| Type | 소스 · sink 구분 |
| Class | 커넥터 구현 |
| Tasks | 태스크 수와 상태 |
| Error | 실패 원인 |
⚠️ 주의
커넥터가
Running인데도 데이터가 들어오지 않을 수 있습니다. 커넥터 상태는 프로세스의 생존이지 적재의 성공을 뜻하지 않습니다. 실제 적재 여부는 Data Quality의 신선도 판정으로 확인하세요.
Data Quality
적재된 데이터가 쓸 수 있는 상태인지 시스템이 내리는 판정입니다.
| 지표 | 의미 |
|---|---|
| PASS | 기준 충족 |
| WARN | 주의 필요 |
| FAIL | 기준 미달 |
| 컬럼 | 의미 |
|---|---|
| Status | 판정 결과 |
| Severity | 심각도 |
| Rule | 판정 규칙 (신선도, 행수, NULL 등) |
| Table | 대상 테이블 |
| Metric | 실제 측정값 |
| Threshold | 기준값 |
| Message | 판정 설명 |
알림 연결
심각도가 높은 판정은 화면에만 남지 않고 알림 채널로 통지됩니다. 파이프라인이 조용히 멈추는 상황을 사람이 화면을 열어야만 발견하는 구조를 없애기 위한 설계입니다.
규제 환경에서는 "몰랐다"가 허용되지 않기 때문에, DQ 판정과 알림은 선택 기능이 아니라 기본 구성으로 다룹니다.
미등록 장비 데이터 유입
telemetry는 들어오는데 자산으로 등록되지 않은 설비를 보여줍니다.
| 지표 | 의미 |
|---|---|
| 고아 장비 | 등록되지 않은 식별자 수 |
| 고아 행수 | 해당 데이터의 행 수 |
| 등록 매칭 | 정상적으로 자산과 연결된 식별자 수 |
원인은 보통 자산 등록 누락, 식별자 오타, 잘못된 토픽 발행 입니다.
ℹ️ 참고
등록되지 않은 데이터도 버리지 않고 Bronze에 그대로 적재합니다. 나중에 자산을 등록하면 그 순간부터 과거 데이터까지 소급해 노출됩니다. 수집 시점에 판정해 버리면 복구가 불가능하기 때문에 택한 방식입니다.
CronJobs
주기 실행되는 작업의 목록과 스케줄 상태입니다. 스케줄을 일시중지하거나 재개할 수 있습니다. 일시중지는 확인 절차를 거칩니다.
실행 이력과 실패 디버깅
개별 실행의 태스크 단위 디버깅은 Data Factory의 파이프라인 탭에서 수행합니다.
| 기능 | 설명 |
|---|---|
| 실행 목록 | 상태, 시각, 소요 시간, 최근 실행 추이 |
| 태스크 로그 | 실패한 태스크의 오류 위치 확인 |
| 실패 태스크만 재실행 | 전체 재실행 대신 실패 지점부터 다시 실행 |
| 상태 변경 | 태스크 · 실행 상태를 수동 조정 |
운영 성격의 조작에는 사유 입력이 요구되고, 기록이 남습니다.
📝 참고
이 화면은 파이프라인을 작성하는 도구가 아니라 운영하는 콘솔입니다. DAG 정의는 코드로 관리하고, 화면에서는 실행 · 재시도 · 확인만 수행합니다.
문제 판단 순서
데이터가 최신이 아닐 때 다음 순서로 확인하면 원인 범위가 빨리 좁혀집니다.
- Data Quality — 어떤 테이블의 어떤 규칙이 실패했는가
- Spark Applications — 해당 적재 작업이 살아 있는가
- 스트리밍 커넥터 — 소스 · sink가 실패 상태인가
- CronJobs — 스케줄이 일시중지되어 있지 않은가
- 파이프라인 실행 이력 — 마지막 성공 실행이 언제인가
잘못 적재된 데이터를 되돌려야 한다면 데이터 복구로 이동합니다.