클러스터 관리 및 구성

Databricks Lakehouse 입문

Gang Wang

Senior Data Scientist

클러스터 찾기

$$

  • All Clusters - 워크스페이스의 모든 클러스터
  • My Clusters - 직접 생성한 클러스터
  • Shared with Me - 다른 사용자가 공유한 클러스터
  • 상태별 필터: Running, Terminated

$$

recraft: half: 색상별로 구분된 폴더와 레이블이 있는 서류함 - 클러스터 필터링과 구성을 나타냄

Databricks Lakehouse 입문

클러스터 상태

flowchart: Pending, Running, Restarting, Terminating, Terminated

Databricks Lakehouse 입문

종료 시 유지되는 것과 삭제되는 것

comparison: Preserved, Configuration, Notebooks, Cloud storage | Lost, In-memory data, Installed libraries, Temp files

  • 종료는 삭제가 아닙니다 - 구성과 노트북은 유지됩니다
  • 메모리 내 데이터, 캐시, pip 설치 패키지는 삭제됩니다
Databricks Lakehouse 입문

재시작이 필요한 경우

$$

  • 라이브러리를 설치했으나 로드되지 않을 때
  • 클러스터가 불안정하거나 속도가 느릴 때
  • 메모리의 캐시 데이터를 초기화해야 할 때
  • 초기화 스크립트 또는 환경 변수를 업데이트했을 때

$$

recraft: half: 파란색과 초록색으로 빛나는 원형 화살표가 있는 전원 버튼 아이콘 - 시스템 재시작 또는 새로 고침을 나타냄

Databricks Lakehouse 입문

자동 스케일링과 자동 종료

$$

Autoscaling and Auto-termination

$$

  • 자동 스케일링은 수요에 따라 워커를 추가하거나 제거합니다
  • 과잉 프로비저닝 없이 부하 급증을 처리합니다
  • 자동 종료는 설정된 유휴 시간 이후 클러스터를 종료합니다
  • 잊고 방치된 클러스터로 인한 비용 낭비를 방지합니다
Databricks Lakehouse 입문

클러스터 정책

$$

  • 클러스터 생성을 위한 관리자 정의 제한
  • 노드 유형, 최대 워커 수, 런타임 버전 제한
  • 자동 종료 및 태깅 적용
  • 사용자는 정책 범위 내에서 클러스터를 생성합니다

$$

{
  "max_workers": 8,
  "auto_termination_minutes": 30,
  "allowed_node_types": [
    "Standard_DS3_v2",
    "Standard_DS4_v2"
  ]
}
Databricks Lakehouse 입문

요약

$$

  • 필터로 원하는 클러스터를 빠르게 찾을 수 있습니다
  • 종료는 비용을 절감하지만 메모리와 라이브러리는 삭제됩니다
  • 재시작으로 새 라이브러리를 적용하거나 문제를 해결합니다
  • 자동 스케일링자동 종료로 비용을 자동으로 관리합니다
  • 클러스터 정책으로 관리자가 표준을 적용합니다
Databricks Lakehouse 입문

연습해 봅시다!

Databricks Lakehouse 입문

Preparing Video For Download...