클러스터 유형과 런타임
Databricks Lakehouse 입문
Gang Wang
Senior Data Scientist
클러스터란?
$$
- 코드를 실행하는 가상 머신의 집합
- 드라이버 노드가 작업을 조율합니다
- 하나 이상의 워커 노드가 처리를 담당합니다
- 클러스터는 클라우드 스토리지에서 데이터를 읽습니다
$$
$$

범용 클러스터
$$
- 대화형 개발 및 임시 쿼리에 활용
- 팀 내 여러 사용자가 공유 가능
- 수동으로 중지할 때까지 계속 실행
- 항상 사용할 수 있지만 유휴 상태에서도 비용이 발생합니다
$$

잡 클러스터
$$
- 작업 시작 시 자동으로 생성
- 단일 작업을 실행한 후 종료
- 수동 관리 불필요
- 프로덕션 워크로드에 비용 최적화
$$

어떤 경우에 무엇을 사용할까요?
$$

- 흔한 실수: 프로덕션 파이프라인을 범용 클러스터에서 실행하는 것
Databricks Runtime
$$
- 모든 클러스터에서 실행되는 버전 관리 소프트웨어 스택
- Apache Spark, Delta Lake, Python, R, Scala 포함
- LTS 버전 - 장기 지원, 프로덕션 환경에 권장
- ML Runtime은 ML 라이브러리를 사전 설치하여 제공
$$

요약
$$
- 범용 클러스터 - 대화형, 공유, 수동 관리
- 잡 클러스터 - 자동화, 단일 작업, 비용 최적화
- Databricks Runtime - 버전 관리 소프트웨어 스택 (프로덕션에는 LTS 권장)
- 비용 절감을 위해 워크로드에 맞는 클러스터 유형을 선택하세요
연습해 봅시다!
Databricks Lakehouse 입문
Preparing Video For Download...