Menggabungkan semuanya

Pengantar Databricks Lakehouse

Gang Wang

Senior Data Scientist

Skenario

$$

  • Anda seorang data engineer memulai proyek baru di perusahaan ritel
  • Tujuan: siapkan komputasi, verifikasi pipeline data, cek tata kelola, dan persiapkan untuk deployment

$$

recraft: half: Seorang data engineer di meja modern dengan laptop menampilkan antarmuka bergaya Databricks, dengan diagram pipeline di papan tulis di belakangnya, mewakili onboarding ke proyek data baru

Pengantar Databricks Lakehouse

Langkah 1: Pilih komputasi yang tepat

$$

  • Pipeline berjalan setiap malam sesuai jadwal
  • Tidak perlu pengembangan interaktif
  • Jobs cluster dengan runtime LTS adalah pilihan tepat
  • Atur autoscaling (2–6 worker) untuk volume data yang bervariasi

$$

Serbaguna Jobs Cluster
Mode Interaktif Otomatis
Pengelolaan Manual Auto-terminate
Biaya Lebih tinggi (waktu idle) Dioptimalkan biaya
Pengantar Databricks Lakehouse

Langkah 2: Verifikasi pipeline medallion

$$

SELECT COUNT(*) FROM bronze_sales;
-- 1,247,832 rows

SELECT COUNT(*) FROM silver_sales;
-- 1,189,456 rows (nulls removed)

SELECT COUNT(*) FROM gold_daily_revenue;
-- 365 rows (daily aggregates)

$$

  • Bronze: data mentah, jumlah baris tertinggi
  • Silver: dibersihkan, null dan duplikat dihapus
  • Gold: diagregasi untuk pelaporan bisnis
  • Jumlah baris menurun saat kualitas meningkat
Pengantar Databricks Lakehouse

Langkah 3: Cek tata kelola

$$

  • Buka Unity Catalog dan periksa tabel gold_daily_revenue
  • Lacak lineage ke hulu untuk memastikan membaca dari silver_sales
  • Verifikasi kontrol akses - hanya tim analitik memiliki SELECT pada gold
  • Konfirmasi Delta Sharing dikonfigurasi untuk mitra eksternal

$$

recraft: half: Sebuah kaca pembesar melayang di atas grafik lineage data yang menampilkan node tabel terhubung dengan tanda centang, mewakili verifikasi tata kelola

Pengantar Databricks Lakehouse

Langkah 4: Siapkan untuk deployment

$$

  • Tinjau Asset Bundle databricks.yml
  • Pastikan resource job malam hari sudah didefinisikan
  • Cek target produksi mengarah ke path workspace yang benar
  • Jalankan bundle validate sebelum deployment

$$

targets:
  production:
    workspace:
      root_path: /Shared/production
resources:
  jobs:
    nightly_sales_etl:
      schedule:
        quartz_cron: "0 0 3 * * ?"
Pengantar Databricks Lakehouse

Ringkasan

$$

  • Komputasi: cocokkan tipe cluster dengan beban kerja (jobs cluster untuk otomatisasi)
  • Data: verifikasi aliran lapisan medallion sudah benar
  • Tata kelola: lacak lineage, cek akses, konfirmasi sharing
  • Deployment: tinjau Asset Bundle, validasi, deploy
Pengantar Databricks Lakehouse

Ayo berlatih!

Pengantar Databricks Lakehouse

Preparing Video For Download...