콘텐츠로 이동
Study NoteDatabricks

5. 분석가와 AI가 쓰는 길

lakehouse의 목적은 table을 많이 만드는 것이 아니라 승인된 정의 하나를 SQL·BI·ML이 반복해서 사용하게 하는 것이다

이 장에서 처음 나오는 말4개
SQL warehouseSQL warehouse
SQL query와 BI connection을 실행하는 Databricks compute endpoint다.
MLflowMLflow
experiment, model artifact와 model lifecycle을 추적하는 ML 운영 기반이다.
servingModel serving
학습된 model이나 AI workload를 online API로 제공하는 실행 경계다.
semantic layerSemantic layer
매출·활성 고객 같은 업무 metric의 계산 정의를 소비 도구가 공유하게 하는 계층이다.
Unity Catalog가 승인한 테이블·모델이 SQL warehouse·노트북·ML 학습으로 갈라져 대시보드·앱·모델 서빙으로 이어지고, row·column 정책이 카탈로그에 걸리는 소비 경로

이 장을 읽고 나면 workload마다 compute를 어떻게 분리하고, 같은 data를 사용하면서도 권한과 SLA를 어떻게 다르게 줄지 설명할 수 있다.

사용자기본 도구주로 읽는 계층운영 원칙
SQL 분석가SQL editor, SQL warehouseGold와 승인된 Silver viewad-hoc와 dashboard warehouse를 필요하면 분리
BI toolJDBC/ODBC connectionsemantic·Gold modelservice principal, query timeout, refresh SLA
data engineernotebook, job, pipelineBronze부터 Goldinteractive와 production job compute 분리
data scientistnotebook, feature·training table, MLflow승인된 Silver·featureexperiment와 production artifact 추적
applicationSQL API 또는 serving endpoint좁은 view·model endpointend-user identity, rate, latency와 failure contract

모든 사람에게 하나의 큰 shared cluster를 주면 cost attribution과 장애 경계가 흐려진다. interactive exploration, scheduled ETL, BI serving과 model serving의 compute를 목적별로 나누고 Unity Catalog에서 data access를 공유한다.

dashboard가 source DB를 직접 보지 않게 한다

섹션 제목: “dashboard가 source DB를 직접 보지 않게 한다”

Gold table의 refresh가 10분마다라면 dashboard SLA도 이를 기준으로 정한다. 실시간처럼 보이게 하려고 온프렘 DB를 직접 query하면 dashboard traffic이 운영 system에 전파된다. 정말 sub-second fresh data가 필요한 use case만 streaming·serving store를 별도 설계한다.

업무 DB transaction
→ CDC lag 1~3분
→ Silver quality check
→ Gold refresh
→ BI cache refresh

이 chain의 각 시각을 기록해야 사용자가 “왜 숫자가 아직 안 바뀌었나”를 설명할 수 있다.

AI도 같은 governance 안에서 시작한다

섹션 제목: “AI도 같은 governance 안에서 시작한다”

ML training data와 model을 Unity Catalog에 연결하면 어느 table version으로 어떤 model이 만들어졌는지 추적하기 쉽다. 사내 문서 기반 RAG를 만들 때도 document 원본, chunk, embedding, vector index와 serving endpoint의 owner·권한·개인정보 정책을 data product처럼 다룬다.

  • data owner와 technical owner
  • schema와 metric 정의
  • refresh SLA와 허용 stale time
  • row·column 보안과 export 허용 범위
  • consumer별 concurrency·latency·비용 예산
  • schema 변경 공지와 downstream 영향 분석
  • 장애 시 마지막 정상 data 시각 표시