Wprowadzenie do Databricks Lakehouse
Gang Wang
Senior Data Scientist
$$
my_project/
|-- databricks.yml
|-- src/
| |-- etl_pipeline.py
| |-- data_quality.py
|-- resources/
| |-- jobs/
| | |-- nightly_etl.yml
| |-- pipelines/
| |-- sales_pipeline.yml
|-- tests/
|-- test_etl.py
$$
databricks.yml - główny plik konfiguracyjnysrc/ - notebooki i kodresources/ - definicje zadań i potokówtests/ - opcjonalne pliki testowebundle:
name: sales_analytics
workspace:
host: https://myworkspace.databricks.com
targets:
dev:
default: true
workspace:
root_path: /Users/me/dev
production:
workspace:
root_path: /Shared/production
permissions:
- level: CAN_MANAGE
group_name: data_engineers
$$

$$
resources:
jobs:
nightly_etl:
name: "Nightly ETL Pipeline"
schedule:
quartz_cron: "0 0 2 * * ?"
tasks:
- task_key: ingest
notebook_task:
notebook_path: src/etl.py
$$
| Polecenie | Cel |
|---|---|
bundle validate |
Sprawdź konfigurację pod kątem błędów |
bundle deploy |
Wdróż do docelowego środowiska |
bundle run |
Uruchom wdrożone zadanie |
bundle destroy |
Usuń wdrożone zasoby |
$$
# Weryfikacja przed wdrożeniem
databricks bundle validate
# Wdrożenie na produkcję
databricks bundle deploy \
--target production
# Uruchomienie zadania
databricks bundle run nightly_etl

$$
$$
databricks.yml definiuje projekt, środowiska docelowe i zasobyvalidate, deploy, run, destroyWprowadzenie do Databricks Lakehouse