작업 생성 및 관리

Python SDK로 Databricks 다루기

Avi Steinberg

Senior Software Engineer

Databricks Notebook 경로

  • Databricks 작업은 Databricks Notebook에 작성된 코드를 실행할 수 있습니다
  • WorkspaceClient.current_user.me().user_name은 로그인한 사용자의 이름을 반환합니다
  • 노트북 경로는 /Users/${username}/${notebook_name} 형식입니다
# Assume there is a notebook in our workspace called My_Notebook
w = WorkspaceClient()
notebook_path = f'/Users/{w.current_user.me().user_name}/My_Notebook'
Python SDK로 Databricks 다루기

Databricks 작업 생성

WorkspaceClient.jobs.create(createParams)

nametasks 매개변수를 전달하여 생성할 작업을 정의합니다

createParams:
  name: str
  tasks: List[Task]
Task:
  description=str
  notebook_task=NotebookTask
  task_key=str
NotebookTask:
  notebook_path: str
1 https://databricks-sdk-py.readthedocs.io/en/latest/workspace/jobs/jobs.html
Python SDK로 Databricks 다루기

Databricks 작업 생성 및 실행

from databricks.sdk import WorkspaceClient

# Create notebook path pointing to notebook called "My_Notebook"
w = WorkspaceClient()
notebook_path = f'/Users/{w.current_user.me().user_name}/My_Notebook'

# Create a job that runs the Datacamp_Test_Notebook new_job = w.jobs.create(name='sdk-dc-project-task', tasks=[jobs.Task( description="create_notebook_test", notebook_task=jobs.NotebookTask(notebook_path=notebook_path), task_key="my-key") ]) print(f"New Job Id={new_job.job_id}")
w.jobs.run_now(job_id=new_job.job_id).result() # Run created Job
1 https://docs.databricks.com/en/dev-tools/sdk-python.html
Python SDK로 Databricks 다루기

Databricks 작업 목록 조회

from databricks.sdk import WorkspaceClient
w = WorkspaceClient()
jobs = w.jobs.list()
for job in jobs:
    print(f"JobId={job.job_id}")
JobId=888763141802192
JobId=37050453972815
JobId=681550316180975
JobId=629994089852037
Python SDK로 Databricks 다루기

Databricks 작업 삭제

WorkspaceClient.jobs.delete(job_id: str)
1 1. https://databricks-sdk-py.readthedocs.io/en/latest/workspace/jobs/jobs.html
Python SDK로 Databricks 다루기

Databricks 작업 삭제

# Pre-requisite to this is to create desired 
# Databricks notebook in databricks cluster
w = WorkspaceClient()
notebook_path = f'/Users/{w.current_user.me().user_name}/My_Notebook'
# Create a job that runs the Datacamp_Test_Notebook
new_job = w.jobs.create(name='sdk-dc-project-task',
                            tasks=[
                              jobs.Task(description="create_notebook_test",
                                        existing_cluster_id=cluster_id,
                      notebook_task=jobs.NotebookTask(notebook_path=notebook_path),
                                        task_key="my-key")
                            ])

w.jobs.delete(job_id=new_job.job_id)
1 1. https://databricks-sdk-py.readthedocs.io/en/latest/workspace/jobs/jobs.html
Python SDK로 Databricks 다루기

Cron 문법

작업 예약을 위한 Cron 표현식:

  1. 매일 오전 3:30:00 = 0 30 3 * * ?
  2. 매일 오후 2:45:00 = 0 45 2 * * ?
1 https://www.quartz-scheduler.org/documentation/quartz-2.3.0/tutorials/crontrigger.html
Python SDK로 Databricks 다루기

작업 예약

매일 오전 3시에 노트북을 실행하도록 작업을 예약할 수 있습니다

# Create a job that runs the Datacamp_Test_Notebook
cron_expression = "0 0 3 * * ?"

created_job = w.jobs.create( name='sdk-dc-project-task', tasks=[jobs.Task(description="test",
notebook_task=jobs.NotebookTask(notebook_path=notebook_path), task_key="my-key")], timeout_seconds=3600,
schedule=jobs.CronSchedule(quartz_cron_expression=cron_expression, timezone_id="America/New_York") )
1 https://databricks-sdk-py.readthedocs.io/en/latest/workspace/jobs/jobs.html
Python SDK로 Databricks 다루기

연습해 봅시다!

Python SDK로 Databricks 다루기

Preparing Video For Download...