문서 목차
데이터셋 등록
카탈로그 테이블, 수집 결과, SQL 결과를 데이터셋으로 등록하는 4단계 절차
QUANTUM C&S
Data Hub 우측 상단의 + 등록 으로 새 데이터셋을 만듭니다. 등록은 소스 선택 → 기본 정보 → README → 확인 4단계로 진행됩니다.
1단계. 소스 선택
| 유형 | 언제 사용하나 |
|---|---|
| 직접 등록 (direct) | 카탈로그에 이미 있는 테이블을 데이터셋으로 노출 |
| 수집 데이터셋 (ingested) | Data Factory 수집 결과 파일을 등록 |
| 파생 데이터셋 (derived) | SQL 결과로 새 테이블을 만들어 등록 |
직접 등록
카탈로그 → 스키마 → 테이블을 차례로 선택합니다. 테이블이 많으면 검색으로 좁힙니다. 선택하면 컬럼 메타데이터를 카탈로그에서 읽어와 개수와 목록을 미리 보여줍니다.
원천 테이블 정보를 함께 입력하면 계보로 기록됩니다.
예: ERP.orders, MES.equipment_status, s3://bucket/path
수집 데이터셋
수집 결과가 저장된 오브젝트 스토리지 경로를 지정합니다. DataHub 등록 탭에서 시작하면 이 값이 자동으로 채워집니다.
파생 데이터셋
새로 만들 스키마 이름과 생성 쿼리를 입력합니다.
CREATE TABLE iceberg.analytics.my_mart AS
SELECT ...
참조한 원천 테이블을 함께 입력하면 계보가 기록됩니다.
iceberg.schema.table, datalake.schema.table
2단계. 기본 정보
| 필드 | 설명 | 필수 |
|---|---|---|
| 이름 | 데이터셋 이름 | ✅ |
| 보안 등급 | 공공 · 내부 · 제한 · 기밀 (기본값 내부정보) | ✅ |
| 소유팀 | 책임 부서 | ✅ |
| 태그 | 쉼표로 구분한 키워드 | 선택 |
| 설명 | 한두 문장 요약 | 선택 |
| API slug | 외부 Data API로 노출할 때 쓰는 경로 이름. 비워두면 자동 생성 | 선택 |
이름 규칙 권장
<도메인>_<주제>_<주기> 형태를 권장합니다. 예: sales_daily_orders, qc_batch_results. 검색 결과의 품질과 AI 질의 정확도에 직접 영향을 줍니다.
API slug
외부 시스템에 이 데이터셋을 공급할 계획이 있으면 slug를 지정합니다. 소문자 · 숫자 · 하이픈만 허용됩니다. → 외부 Data API
3단계. README
마크다운 문서를 작성합니다. 템플릿 삽입 을 누르면 표준 양식이 채워집니다.
빈 README로도 등록은 되지만, 다른 사용자가 이 데이터를 쓸 수 있는지 판단할 근거가 없어집니다. 최소한 개요와 주의사항은 채우는 것을 권장합니다.
4단계. 확인
입력값 요약을 검토하고 등록합니다. 요약에는 선택한 테이블, 컬럼 개수, README 작성 여부가 함께 표시됩니다.
등록이 완료되면 데이터셋이 즉시 목록에 나타납니다.
등록 후 할 일
- 프리뷰를 한 번 실행해 데이터가 정상인지 확인합니다.
- 개인정보가 포함된 컬럼이 있으면 마스킹 대상으로 등록합니다. → 분류와 마스킹
- 보안 등급이 실제 데이터 성격과 맞는지 다시 확인합니다.
- 정기 갱신이 필요하면 파이프라인으로 등록합니다. → Data Factory
자주 발생하는 오류
| 상황 | 원인 | 조치 |
|---|---|---|
| 이름 중복 | 같은 이름의 데이터셋 존재 | 다른 이름 사용 또는 기존 데이터셋 수정 |
| 경로를 읽을 수 없음 | 저장 경로 오타 또는 권한 부족 | 경로 재확인, 운영 담당자에게 권한 확인 |
| 컬럼 메타데이터 없음 | 카탈로그에서 컬럼을 읽지 못함 | 테이블 접근 권한과 카탈로그 상태 확인 |
| 권한 부족 | 등록 권한 없음 | 데이터 큐레이터 권한 요청 |