Databricks Lakehouse Platform의 핵심 기능

Databricks 개념

Kevin Barlow

Data Practitioner

Apache Spark

Apache Spark는 오픈 소스 데이터 처리 프레임워크로, Databricks의 엔진입니다.

DataCamp 강의

  • Introduction to Pyspark
  • Big Data Fundamentals with Pyspark
  • Cleaning Data with Pyspark
  • Machine Learning with Pyspark
  • Introduction to Spark SQL in Python
Databricks 개념

Spark의 이점

핵심 이점:

  1. 확장 가능하고 유연한 오픈 소스 프레임워크
  2. 큰 개발자 커뮤니티
  3. 고성능
  4. Databricks 최적화

Spark 클러스터 다이어그램

1 https://spark.apache.org/docs/latest/cluster-overview.html
Databricks 개념

클라우드 컴퓨팅 기초

클래식 컴퓨팅

클라우드 컴퓨팅

Databricks 개념

Databricks 컴퓨트

클러스터

  • 계산 리소스 모음
  • 모든 워크로드, 모든 용도
  • 범용 vs. Jobs

Databricks 지원 언어

SQL 웨어하우스

  • SQL 전용
  • BI 용도
  • Photon

SQL 언어

Databricks 개념

클라우드 데이터 저장소

클라우드 데이터 저장소 - DB

클라우드 데이터 저장소 - 파일

Databricks 개념

Delta

Delta Lake 로고

Delta는 오픈 소스 데이터 저장 파일 형식이며 다음을 제공합니다:

  • ACID 트랜잭션
  • 배치와 스트리밍 통합
  • 스키마 진화
  • 테이블 이력
  • 타임 트래블
1 delta.io
Databricks 개념

Unity Catalog

Unity Catalog는 Databricks Lakehouse 전반의 모든 데이터 자산 접근을 제어하는 오픈 데이터 거버넌스 전략입니다.

  • 접근 제어를 위한 SQL GRANT, REVOKE
  • 간단한 거버넌스 인터페이스

데이터 카탈로그

Databricks 개념

Databricks UI

데이터 워크로드에 맞춰 기능에 쉽게 접근하도록 설계되었습니다.

  • 모든 사용자가 데이터와 컴퓨트에 접근
  • SQL 사용자는 친숙한 쿼리·리포트 인터페이스 제공
  • 데이터 엔지니어는 Delta Live Tables 활용
  • 머신러닝 워크로드는 모델, 피처 등 사용

Databricks 메뉴

Databricks 개념

복습해 봅시다!

Databricks 개념

Preparing Video For Download...