문서 목차
핵심 개념
데이터셋, 메달리온 계층, 보안 등급, 자산과 배치 등 AkashiQ 전반에서 쓰이는 용어
QUANTUM C&S
화면 설명에 반복해서 등장하는 개념을 먼저 정리합니다. 용어 정의만 빠르게 찾으려면 용어집을 참고하세요.
데이터가 흐르는 순서
[ 원천 시스템 ] [ 수집 ] [ 레이크하우스 ] [ 활용 ]
DB · 설비 · 문서 → Data Factory → Bronze → Silver → Compute · 웹 · API CDC · 스트리밍 → Gold (Iceberg) Data Hub
SAMANDA
외부 API
| 단계 | 담당 화면 | 결과물 |
|---|---|---|
| 원천에서 가져오기 | Data Factory | 오브젝트 스토리지의 적재 파일, Bronze 테이블 |
| 정제 · 이력화 | Pipeline Ops | Silver 이력 테이블, Gold 분석 테이블 |
| 등록 · 탐색 | Data Hub · Data Catalogs | 데이터셋 카드, 카탈로그 트리 |
| 분석 · 공급 | Compute · SAMANDA · 외부 API | SQL 결과, AI 응답, API 응답 |
데이터셋 (Dataset)
Data Hub에 등록되는 데이터 자산의 최소 단위입니다. 이름, 설명, 보안 등급, 태그, 소유팀, 컬럼 정보, 문서(README)를 가집니다. 세 가지 유형이 있습니다.
| 유형 | 의미 | 예시 |
|---|---|---|
direct |
카탈로그에 이미 있는 테이블을 그대로 등록 | Iceberg 테이블 |
ingested |
수집 결과 파일을 등록 | 적재된 JSONL · CSV |
derived |
SQL 결과로 새로 만든 데이터셋 | 일별 집계 결과 |
카탈로그 · 스키마 · 테이블
Trino의 3단계 계층입니다. 화면에서는 보통 catalog.schema.table 형식으로 표기합니다.
- 카탈로그 — 데이터 소스 단위 (
iceberg,postgresql,mysql등) - 스키마 — 카탈로그 안의 논리 그룹 (도메인 단위)
- 테이블 — 실제 데이터 단위
메달리온 계층 (Bronze · Silver · Gold)
적재와 가공 단계를 분리해 원본을 훼손하지 않고 품질을 올리는 구조입니다.
| 계층 | 성격 | 특징 |
|---|---|---|
| Bronze | 원본 보존 | 원천에서 받은 그대로 적재. 판단 · 필터를 넣지 않습니다. |
| Silver | 정제 · 이력 | 표준 컬럼으로 정리하고 변경 이력(SCD2)을 유지합니다. |
| Gold | 분석용 | 조인 · 집계를 끝낸 상태. 조회와 학습에 바로 씁니다. |
Bronze를 남겨두기 때문에, 정제 로직이 잘못됐을 때 Silver를 다시 계산해 복구할 수 있습니다. → 데이터 복구
변경 이력 (SCD2)
원천의 값이 바뀌었을 때 기존 행을 덮어쓰지 않고, 유효 시작 · 종료 시각을 가진 새 행을 추가하는 방식입니다. "그 시점에 이 값이 무엇이었는지"를 나중에 되짚을 수 있어 규제 대응의 기본이 됩니다.
*_latest— 현재 최신 상태만 보는 뷰*_history— 변경 이력 전체를 담은 테이블
보안 등급 (Classification)
모든 데이터는 네 등급 중 하나로 분류합니다.
| 등급 | 의미 |
|---|---|
| 공공정보 | 외부 공개 가능 |
| 내부정보 | 사내 일반 공개 |
| 제한정보 | 부서 · 역할 제한 |
| 기밀정보 | 최고 등급, 별도 승인 |
등급은 접근 정책, 컬럼 마스킹, SAMANDA 응답 범위에 함께 반영됩니다.
수집 작업 (Ingest Job)
Data Factory에서 만드는 외부 데이터 수집 단위입니다. 소스 유형(DB · RSS · HTTP API · Atlassian 등), 연결 정보, 출력 포맷, 적재 경로를 담습니다. 즉시 실행하거나 파이프라인으로 실행합니다.
Virtual Warehouse
쿼리 실행에 쓰는 리소스 풀입니다. 크기(XS~L)를 지정해 만들고, 무거운 분석과 일반 조회를 서로 다른 워크하우스로 분리해 영향 범위를 줄입니다. Trino 리소스 그룹과 연결됩니다.
자산 (Asset)
현장의 물리 대상입니다. 계층으로 등록합니다.
| 유형 | 의미 |
|---|---|
| 라인(line) | 여러 설비를 묶는 상위 단위. 하위 설비 상태를 롤업해 표시합니다. |
| 설비(equipment) | 센서 값이 실시간으로 들어오는 생산 설비 |
| 분석기기(instrument) | 시험 · 측정 장비. 검교정과 적격성(IQ/OQ/PQ) 상태를 관리합니다. |
자산에는 정상 범위(normal range) 와 규격(spec) 을 둘 수 있고, 이 값이 라이브 데이터 판정과 위험 신호의 기준이 됩니다.
마스터 데이터
이기종 시스템을 연결하는 공통 키를 제공하는 기준 정보입니다.
| 항목 | 역할 |
|---|---|
| 제품(Product) | 무엇을 만드는지 |
| 공정 단계(Process Step) | 어떤 단계를 거치는지. 단계별 설비 유형(equipment class)을 정의합니다. |
| 레시피(Recipe) | 제품별 공정 순서와 목표 공정 조건(CPP) |
| ID 매핑 | 시스템마다 다른 식별자를 표준 식별자에 연결 |
배치 (Batch)
제조 실행 단위이며, 서로 다른 시스템의 데이터를 하나로 묶는 기준 축입니다. 같은 batch_id로 공정 실측(설비), 품질 시험 결과(실험실), 관련 문서(문서관리시스템)를 연결해 한 화면에서 추적합니다. → Batch Trace
품질 기록
| 용어 | 의미 |
|---|---|
| 일탈(Deviation) | 정해진 절차 · 기준에서 벗어난 사건 |
| CAPA | 시정 및 예방 조치 |
| OOS | 규격 이탈(Out Of Specification) 시험 결과 |
| 변경 관리(Change Control) | 승인 절차를 거치는 변경 기록 |
데이터 품질 판정 (DQ)
적재된 데이터가 쓸 수 있는 상태인지 시스템이 판정합니다.
| 체크 | 판정 기준 |
|---|---|
| 신선도(freshness) | 최근 데이터가 기대 주기 안에 들어왔는가 |
| 볼륨(volume) | 기대 범위의 행수가 적재됐는가 |
| NULL | 필수 컬럼에 빈 값이 없는가 |
판정 결과는 화면에 표시되고, 임계를 넘으면 알림으로 통지됩니다. → Pipeline Ops
감사 로그와 위반
- 감사 로그 — 로그인, 쿼리 실행, 데이터셋 등록, 정책 변경 등 활동 기록
- 정책 위반 — 정책에 의해 거부된 접근 시도 기록
권한 모델 요약
| 역할 | 대표 권한 |
|---|---|
| 일반 사용자 | 데이터셋 탐색, 프리뷰, SQL 실행, AI 질의 |
| 데이터 큐레이터 | 데이터셋 등록 · 수정, 태그 · 문서 관리 |
| 거버넌스 관리자 | 접근 정책 편집, 감사 · 위반 조회, 마스킹 규칙 관리 |
| 플랫폼 관리자 | 카탈로그 · 워크하우스 관리, 연동 설정, 복구 실행 |
포털 메뉴는 그룹(팀) 권한에 따라 노출 범위가 달라집니다. 권한이 없는 메뉴는 화면에 나타나지 않습니다.