Databricks con el SDK de Python
Avi Steinberg
Senior Software Engineer
WorkspaceClient.current_user.me().user_name obtiene el usuario conectado/Users/${username}/${notebook_name}# Supón que hay un notebook en el workspace llamado My_Notebook
w = WorkspaceClient()
notebook_path = f'/Users/{w.current_user.me().user_name}/My_Notebook'
WorkspaceClient.jobs.create(createParams)
Pasa los parámetros name y tasks para describir el job que se crea
createParams:
name: str
tasks: List[Task]
Task:
description=str
notebook_task=NotebookTask
task_key=str
NotebookTask:
notebook_path: str
from databricks.sdk import WorkspaceClient # Crea la ruta a un notebook llamado "My_Notebook" w = WorkspaceClient() notebook_path = f'/Users/{w.current_user.me().user_name}/My_Notebook'# Crea un job que ejecuta Datacamp_Test_Notebook new_job = w.jobs.create(name='sdk-dc-project-task', tasks=[jobs.Task( description="create_notebook_test", notebook_task=jobs.NotebookTask(notebook_path=notebook_path), task_key="my-key") ]) print(f"New Job Id={new_job.job_id}")w.jobs.run_now(job_id=new_job.job_id).result() # Ejecuta el job creado
from databricks.sdk import WorkspaceClient
w = WorkspaceClient()
jobs = w.jobs.list()
for job in jobs:
print(f"JobId={job.job_id}")
JobId=888763141802192
JobId=37050453972815
JobId=681550316180975
JobId=629994089852037
WorkspaceClient.jobs.delete(job_id: str)
# Requisito previo: crear el notebook deseado # de Databricks en el clúster de Databricks w = WorkspaceClient() notebook_path = f'/Users/{w.current_user.me().user_name}/My_Notebook' # Crea un job que ejecuta Datacamp_Test_Notebook new_job = w.jobs.create(name='sdk-dc-project-task', tasks=[ jobs.Task(description="create_notebook_test", existing_cluster_id=cluster_id, notebook_task=jobs.NotebookTask(notebook_path=notebook_path), task_key="my-key") ])w.jobs.delete(job_id=new_job.job_id)
Expresiones cron para programar a:
0 30 3 * * ? 0 45 2 * * ?Podemos programar un job para ejecutar el notebook cada día a las 3 a. m.
# Crea un job que ejecuta Datacamp_Test_Notebook cron_expression = "0 0 3 * * ?"created_job = w.jobs.create( name='sdk-dc-project-task', tasks=[jobs.Task(description="test",notebook_task=jobs.NotebookTask(notebook_path=notebook_path), task_key="my-key")], timeout_seconds=3600,schedule=jobs.CronSchedule(quartz_cron_expression=cron_expression, timezone_id="America/New_York") )
Databricks con el SDK de Python