본문 바로가기

데이터 레이크하우스

흩어진 정형 · 비정형 데이터를 하나의 분석 기반으로 연결합니다. 업무 시스템과 문서, 설비 데이터를 수집 · 정제 · 저장하고 분석과 AI 활용이 가능한 데이터 자산으로 전환합니다.

OVERVIEW

데이터를 모으는 것에서 끝내지 않고, 분석과 AI가 바로 활용할 수 있게 준비합니다.

데이터 레이크하우스는 원본을 보존하는 데이터 레이크의 유연성과, 정제된 데이터를 안정적으로 분석하는 데이터 웨어하우스의 장점을 하나의 구조로 연결합니다.

분산된 데이터를 수집하고 표준화하여, BI 분석부터 AI 모델 학습과 자연어 질의까지 하나의 데이터 기반 위에서 실행합니다.

01 · COLLECT

다양한 데이터 수집

PLC · SCADA · MES · LIMS를 표준 프로토콜과 CDC로 연결

02 · STORE

원본 보존

형식과 출처를 유지한 채 데이터를 안정적으로 저장

03 · REFINE

정제 · 표준화

Bronze–Silver–Gold 단계로 품질과 활용 목적에 맞게 가공

04 · USE

분석 · AI 활용

BI, SQL 분석, 모델 학습과 자연어 데이터 질의로 확장

흩어진 데이터를 신뢰할 수 있는 하나의 분석 자산으로 전환합니다.

CHALLENGES

데이터는 쌓이고 있지만, 시스템 사이에서는 여전히 연결되지 않습니다.

업무 시스템별로 데이터가 분리되고 수집 · 정제 방식도 달라지면서, 분석과 AI 활용을 위한 준비에 더 많은 시간이 소요됩니다.

01

업무 시스템마다 데이터가 분산돼 있습니다.

ERP · MES · LIMS · 문서관리 등 시스템별 저장 구조가 달라 전사 데이터를 한 번에 파악하기 어렵습니다.

02

정형 데이터와 비정형 데이터가 따로 관리됩니다.

DB의 수치 데이터와 문서 · 이미지 · 파일이 서로 분리되어 통합 분석과 AI 학습 데이터 구성이 어렵습니다.

03

운영 시스템에 부담 없이 데이터를 수집하기 어렵습니다.

대량 조회와 반복 추출은 운영 DB 성능에 영향을 줄 수 있어 실시간 데이터 활용이 제한됩니다.

04

수작업 추출과 엑셀 취합이 반복됩니다.

부서마다 필요한 데이터를 직접 내려받고 결합하면서 분석 준비 시간이 길어지고 오류 가능성도 커집니다.

05

데이터 품질과 정합성을 신뢰하기 어렵습니다.

데이터가 어디서 왔고 어떻게 변경됐는지 추적하기 어려워 의사결정과 AI 모델에 바로 활용하기 어렵습니다.

SOLUTION

수집부터 품질 · 계보까지, 데이터 Lifecycle 전체를 하나로 연결합니다.

운영 시스템의 부담을 줄이면서 데이터를 적재하고, 개방형 표준과 단계형 정제를 통해 분석과 AI 활용에 적합한 구조를 만듭니다.

01

무부하 데이터 수집 · 적재

CDC · API · 파일 · 설비 프로토콜로 정형 · 비정형 데이터를 연결하고, 운영 시스템의 성능 영향을 최소화하며 실시간 · 배치로 동기화합니다.

02

Bronze – Silver – Gold 정제

원본 보존, 정제 · 표준화, 분석용 통합 데이터로 단계별 목적을 분리합니다.

03

개방형 테이블 포맷

Apache Iceberg 기반으로 특정 벤더에 종속되지 않는 분석 데이터 구조를 제공합니다.

04

분산 SQL 통합 분석

Trino · Spark 등과 연결해 여러 데이터 소스를 표준 SQL로 분석합니다.

05

데이터 품질 자동 판정

누락 · 중복 · 범위 오류와 정합성 문제를 자동으로 확인하고 알림을 제공합니다.

06

계보 · 거버넌스 추적

데이터의 출처와 변경 이력을 추적하고 접근권한과 감사 기준을 함께 관리합니다.

ARCHITECTURE

원천 시스템에서 분석과 AI까지, 데이터가 끊기지 않는 서비스 흐름

AkashiQ을 중심으로 데이터 수집 · 정제 · 저장 · 품질 · 계보를 통합하고, 기존 BI와 AI 서비스가 같은 데이터 자산을 활용하도록 연결합니다.

Enterprise Data Lakehouse Flow

정형 · 비정형 데이터를 하나의 개방형 데이터 기반으로 통합하고, 목적에 따라 분석 · AI · 자연어 질의로 활용합니다.

ERP · MES · LIMS

CDC 기반 운영 시스템 무부하 연동

문서관리 · EDMS

API · PDF · Word · Excel · 이미지

설비 · PLC / SCADA

OPC-UA 기반 실시간 데이터 수집

파일 · 외부 데이터

Batch · Object · Log · 기타 데이터

AKASHIQ · DATA LAKEHOUSE

수집 · 정제 · 저장 · 품질 · 계보

원본 데이터를 보존하면서 분석과 AI에 필요한 형태로 단계적으로 준비합니다.

Bronze

원본 보존

Silver

정제 · 표준화

Gold

분석용 통합

Apache Iceberg · Open Table Format데이터 품질(DQ) 자동 판정 · 알림데이터 계보(Lineage) · 권한 · 거버넌스

BI · 리포트

표준 SQL 기반 기존 분석 도구 연계

KosmosAI

분석 · 모델 학습 · 예측 · 이상 감지

SAMANDA

자연어 데이터 질의 · Text-to-SQL

기반 플랫폼 : ORKESTRIX온프레미스 Kubernetes 환경 설치 · 운영
AkashiQ

수집 · 정제 · 저장 · 품질 · 계보 · 거버넌스

ORKESTRIX

데이터 플랫폼의 설치 · 운영 실행 기반

KosmosAI

적재 데이터 기반 분석과 AI 모델 활용

SAMANDA

자연어 데이터 질의와 Text-to-SQL 확장

BUSINESS VALUE

데이터를 찾고 합치는 시간을 줄이고, 분석과 AI 활용 속도를 높입니다.

01 · SINGLE ACCESS

전사 데이터 단일 접근 창구

시스템과 부서에 흩어진 데이터를 하나의 카탈로그와 질의 경로에서 찾고 활용합니다.

02 · UNIFIED ANALYTICS

시스템 간 통합 분석

ERP · MES · LIMS · 문서 데이터를 표준 SQL로 연결해 시스템 경계를 넘어 함께 분석합니다.

03 · ZERO IMPACT

운영 시스템 무부하 동기화

CDC와 스트리밍을 활용해 운영 DB의 성능 영향을 최소화하면서 데이터를 실시간 · 배치로 동기화합니다.

04 · OPEN STANDARD

기존 BI와 표준 연계

개방형 테이블 포맷과 표준 SQL을 기반으로 기존 BI와 분석 도구를 그대로 연결합니다.

05 · TRUSTED DATA

신뢰할 수 있는 데이터 기반

데이터 품질 판정과 계보를 통해 출처, 처리 과정과 변경 이력을 확인하고 분석과 AI의 신뢰도를 높입니다.

APPLICATIONS

여러 시스템에 분산된 데이터를 하나의 분석 · AI 기반으로 통합합니다.

업무 · 문서 · 현장 데이터를 한곳에 연결해 분석과 AI가 활용할 수 있는 공통 데이터 기반을 구축합니다.

제약 · 제조 데이터 기반

MES · LIMS · 설비 · 품질 데이터를 연결해 공정 분석과 AI 활용을 위한 기반을 구축합니다.

  • 생산 · 설비 · 품질 데이터 수집
  • LOT · 배치 단위 통합 분석
  • 문서 · DB 데이터 통합 저장
  • 분석 · AI 모델용 데이터 제공