作业创建与管理

使用 Python SDK 的 Databricks

Avi Steinberg

Senior Software Engineer

Databricks Notebook 路径

  • Databricks 作业可运行 Databricks Notebook 中的代码
  • WorkspaceClient.current_user.me().user_name 获取当前登录用户的用户名
  • Notebook 路径为 /Users/${username}/${notebook_name}
# 假设工作区中有名为 My_Notebook 的 notebook
w = WorkspaceClient()
notebook_path = f'/Users/{w.current_user.me().user_name}/My_Notebook'
使用 Python SDK 的 Databricks

创建 Databricks 作业

WorkspaceClient.jobs.create(createParams)

传入 nametasks 参数来描述要创建的作业

createParams:
  name: str
  tasks: List[Task]
Task:
  description=str
  notebook_task=NotebookTask
  task_key=str
NotebookTask:
  notebook_path: str
1 https://databricks-sdk-py.readthedocs.io/en/latest/workspace/jobs/jobs.html
使用 Python SDK 的 Databricks

创建并运行 Databricks 作业

from databricks.sdk import WorkspaceClient

# 创建指向名为 "My_Notebook" 的 notebook 的路径
w = WorkspaceClient()
notebook_path = f'/Users/{w.current_user.me().user_name}/My_Notebook'

# 创建一个运行 Datacamp_Test_Notebook 的作业 new_job = w.jobs.create(name='sdk-dc-project-task', tasks=[jobs.Task( description="create_notebook_test", notebook_task=jobs.NotebookTask(notebook_path=notebook_path), task_key="my-key") ]) print(f"New Job Id={new_job.job_id}")
w.jobs.run_now(job_id=new_job.job_id).result() # 运行已创建的作业
1 https://docs.databricks.com/en/dev-tools/sdk-python.html
使用 Python SDK 的 Databricks

列出 Databricks 作业

from databricks.sdk import WorkspaceClient
w = WorkspaceClient()
jobs = w.jobs.list()
for job in jobs:
    print(f"JobId={job.job_id}")
JobId=888763141802192
JobId=37050453972815
JobId=681550316180975
JobId=629994089852037
使用 Python SDK 的 Databricks

删除 Databricks 作业

WorkspaceClient.jobs.delete(job_id: str)
1 1. https://databricks-sdk-py.readthedocs.io/en/latest/workspace/jobs/jobs.html
使用 Python SDK 的 Databricks

删除 Databricks 作业

# 前提:已在 Databricks 集群上创建所需的 Notebook
w = WorkspaceClient()
notebook_path = f'/Users/{w.current_user.me().user_name}/My_Notebook'
# 创建一个运行 Datacamp_Test_Notebook 的作业
new_job = w.jobs.create(name='sdk-dc-project-task',
                            tasks=[
                              jobs.Task(description="create_notebook_test",
                                        existing_cluster_id=cluster_id,
                      notebook_task=jobs.NotebookTask(notebook_path=notebook_path),
                                        task_key="my-key")
                            ])

w.jobs.delete(job_id=new_job.job_id)
1 1. https://databricks-sdk-py.readthedocs.io/en/latest/workspace/jobs/jobs.html
使用 Python SDK 的 Databricks

Cron 语法

用于在以下时间调度作业的 Cron 表达式:

  1. 每天凌晨 3:30:00 = 0 30 3 * * ?
  2. 每天下午 2:45:00 = 0 45 2 * * ?
1 https://www.quartz-scheduler.org/documentation/quartz-2.3.0/tutorials/crontrigger.html
使用 Python SDK 的 Databricks

调度作业

我们可以将作业安排为每天凌晨 3 点运行 notebook

# 创建一个运行 Datacamp_Test_Notebook 的作业
cron_expression = "0 0 3 * * ?"

created_job = w.jobs.create( name='sdk-dc-project-task', tasks=[jobs.Task(description="test",
notebook_task=jobs.NotebookTask(notebook_path=notebook_path), task_key="my-key")], timeout_seconds=3600,
schedule=jobs.CronSchedule(quartz_cron_expression=cron_expression, timezone_id="America/New_York") )
1 https://databricks-sdk-py.readthedocs.io/en/latest/workspace/jobs/jobs.html
使用 Python SDK 的 Databricks

Vamos praticar!

使用 Python SDK 的 Databricks

Preparing Video For Download...