Taken aanmaken en beheren

Databricks met de Python SDK

Avi Steinberg

Senior Software Engineer

Pad van een Databricks-notebook

  • Databricks-taken kunnen code draaien uit een Databricks-notebook
  • WorkspaceClient.current_user.me().user_name haalt de gebruikersnaam van de ingelogde gebruiker op
  • Het notebookpad is /Users/${username}/${notebook_name}
# Ga uit van een notebook in onze workspace met de naam My_Notebook
w = WorkspaceClient()
notebook_path = f'/Users/{w.current_user.me().user_name}/My_Notebook'
Databricks met de Python SDK

Een Databricks-taak aanmaken

WorkspaceClient.jobs.create(createParams)

Geef de parameters name en tasks door om de aan te maken taak te beschrijven

createParams:
  name: str
  tasks: List[Task]
Task:
  description=str
  notebook_task=NotebookTask
  task_key=str
NotebookTask:
  notebook_path: str
1 https://databricks-sdk-py.readthedocs.io/en/latest/workspace/jobs/jobs.html
Databricks met de Python SDK

Een Databricks-taak maken en uitvoeren

from databricks.sdk import WorkspaceClient

# Maak het notebookpad voor een notebook "My_Notebook"
w = WorkspaceClient()
notebook_path = f'/Users/{w.current_user.me().user_name}/My_Notebook'

# Maak een taak die het Datacamp_Test_Notebook draait new_job = w.jobs.create(name='sdk-dc-project-task', tasks=[jobs.Task( description="create_notebook_test", notebook_task=jobs.NotebookTask(notebook_path=notebook_path), task_key="my-key") ]) print(f"New Job Id={new_job.job_id}")
w.jobs.run_now(job_id=new_job.job_id).result() # Voer de aangemaakte taak nu uit
1 https://docs.databricks.com/en/dev-tools/sdk-python.html
Databricks met de Python SDK

Databricks-taken bekijken

from databricks.sdk import WorkspaceClient
w = WorkspaceClient()
jobs = w.jobs.list()
for job in jobs:
    print(f"JobId={job.job_id}")
JobId=888763141802192
JobId=37050453972815
JobId=681550316180975
JobId=629994089852037
Databricks met de Python SDK

Een Databricks-taak verwijderen

WorkspaceClient.jobs.delete(job_id: str)
1 1. https://databricks-sdk-py.readthedocs.io/en/latest/workspace/jobs/jobs.html
Databricks met de Python SDK

Een Databricks-taak verwijderen

# Voorwaarde: maak eerst het gewenste 
# Databricks-notebook in de Databricks-cluster
w = WorkspaceClient()
notebook_path = f'/Users/{w.current_user.me().user_name}/My_Notebook'
# Maak een taak die het Datacamp_Test_Notebook draait
new_job = w.jobs.create(name='sdk-dc-project-task',
                            tasks=[
                              jobs.Task(description="create_notebook_test",
                                        existing_cluster_id=cluster_id,
                      notebook_task=jobs.NotebookTask(notebook_path=notebook_path),
                                        task_key="my-key")
                            ])

w.jobs.delete(job_id=new_job.job_id)
1 1. https://databricks-sdk-py.readthedocs.io/en/latest/workspace/jobs/jobs.html
Databricks met de Python SDK

Cron-syntax

Cron-expressie om te plannen op:

  1. 03:30:00 elke dag = 0 30 3 * * ?
  2. 14:45:00 elke dag = 0 45 2 * * ?
1 https://www.quartz-scheduler.org/documentation/quartz-2.3.0/tutorials/crontrigger.html
Databricks met de Python SDK

Een taak inplannen

We kunnen een taak plannen om het notebook elke dag om 3:00 uit te voeren

# Maak een taak die het Datacamp_Test_Notebook draait
cron_expression = "0 0 3 * * ?"

created_job = w.jobs.create( name='sdk-dc-project-task', tasks=[jobs.Task(description="test",
notebook_task=jobs.NotebookTask(notebook_path=notebook_path), task_key="my-key")], timeout_seconds=3600,
schedule=jobs.CronSchedule(quartz_cron_expression=cron_expression, timezone_id="America/New_York") )
1 https://databricks-sdk-py.readthedocs.io/en/latest/workspace/jobs/jobs.html
Databricks met de Python SDK

Laten we oefenen!

Databricks met de Python SDK

Preparing Video For Download...