데이터 인텔리전스 플랫폼 - 컴퓨팅

Databricks 입문

Kevin Barlow

Data Practitioner

조직이 컴퓨팅을 신경 쓰는 이유는?

단일 톱니바퀴

기어 시스템

Databricks 입문

Apache Spark

  • Databricks 공동 창립자가 개발
  • 오픈 소스 프레임워크
  • 매우 효율적인 분산 컴퓨팅
  • Python, SQL, Scala, R용 API
  • 모든 사용 사례에 적합:
    • 데이터 엔지니어링부터 머신러닝, BI까지

DataCamp의 Apache Spark 강의를 확인해 보세요!

Apache Spark 로고

Databricks 입문

클러스터 유형

클래식

  • 컴퓨팅 리소스(VM)는 컴퓨트 플레인에서 생성됩니다
  • Databricks가 귀사의 클라우드로 구성을 제공합니다
  • 장점: 컴퓨팅과 보안이 귀사 환경에 있음, 기존 컴퓨트 풀 활용 가능 등
  • 단점: 시작이 느림

Databricks 컨트롤 플레인

Databricks 입문

클러스터 유형

서버리스

  • 컴퓨팅 리소스(VM)는 컨트롤 플레인에서 생성됩니다
  • Databricks가 사용자에게 액세스를 제공합니다
  • 장점: 빠른 시작, 최신 기능, 최고 성능, 시간이 지날수록 Databricks가 성능 개선
  • 단점: 컴퓨팅이 귀사 환경 밖에 있음

서버리스 아키텍처

Databricks 입문

싱글 노드 vs. 멀티 노드

싱글 노드

  • 드라이버 노드만 있는 클러스터
  • Spark 실행 가능
  • 단일 노드 프레임워크도 실행 가능(예: pandas)
  • 소규모 데이터에 적합

싱글 노드 클러스터

멀티 노드

  • 드라이버 노드와 하나 이상의 워커 노드가 있는 클러스터
  • Spark가 작업을 여러 노드로 분산
  • 대규모 데이터에 적합

멀티 노드 클러스터

Databricks 입문

Databricks Runtime

  • 모든 Databricks 클러스터에 설치
    • 최적화된 Apache Spark 버전
    • 더 빠른 SQL을 위한 Photon
    • 공통 라이브러리(예: pandas, dplyr, sci-kit learn)
    • Databricks 서비스 연결 로직

권장 사항: 최신 LTS(Long Term Support) Runtime 사용

Databricks Runtime이 있는 클러스터

Databricks 입문

연습해 봅시다!

Databricks 입문

Preparing Video For Download...