รวมทุกอย่างเข้าด้วยกัน

Introduction to Databricks Lakehouse

Gang Wang

Senior Data Scientist

สถานการณ์

$$

  • คุณเป็น data engineer ที่เริ่มโปรเจกต์ใหม่ในบริษัทค้าปลีก
  • เป้าหมาย: ตั้งค่า compute ตรวจสอบ data pipeline ดู governance และเตรียมพร้อม deploy

$$

recraft: half: data engineer นั่งทำงานที่โต๊ะสมัยใหม่ มีแล็ปท็อปแสดงอินเทอร์เฟซแบบ Databricks และไดอะแกรม pipeline บนไวต์บอร์ดด้านหลัง

Introduction to Databricks Lakehouse

ขั้นตอนที่ 1: เลือก compute ให้เหมาะสม

$$

  • Pipeline รันตาม schedule ทุกคืน
  • ไม่จำเป็นต้องพัฒนาแบบ interactive
  • Jobs cluster ที่ใช้ LTS runtime เหมาะสมที่สุด
  • ตั้ง autoscaling (2–6 workers) รองรับปริมาณข้อมูลที่ผันแปร

$$

All-Purpose Jobs Cluster
โหมด Interactive Automated
การจัดการ Manual Auto-terminates
ต้นทุน สูง (idle time) ประหยัดต้นทุน
Introduction to Databricks Lakehouse

ขั้นตอนที่ 2: ตรวจสอบ medallion pipeline

$$

SELECT COUNT(*) FROM bronze_sales;
-- 1,247,832 rows

SELECT COUNT(*) FROM silver_sales;
-- 1,189,456 rows (nulls removed)

SELECT COUNT(*) FROM gold_daily_revenue;
-- 365 rows (daily aggregates)

$$

  • Bronze: ข้อมูลดิบ จำนวนแถวมากที่สุด
  • Silver: ข้อมูลที่ทำความสะอาดแล้ว ลบ null และข้อมูลซ้ำออก
  • Gold: ข้อมูลที่รวมแล้ว สำหรับรายงานธุรกิจ
  • จำนวนแถวลดลงเมื่อคุณภาพข้อมูลสูงขึ้น
Introduction to Databricks Lakehouse

ขั้นตอนที่ 3: ตรวจสอบ governance

$$

  • ไปที่ Unity Catalog และตรวจสอบตาราง gold_daily_revenue
  • ติดตาม lineage ย้อนกลับเพื่อยืนยันว่าอ่านข้อมูลจาก silver_sales
  • ตรวจสอบ access controls — เฉพาะทีม analytics เท่านั้นที่มีสิทธิ์ SELECT บน gold
  • ยืนยันว่า Delta Sharing ตั้งค่าไว้สำหรับ partner ภายนอกแล้ว

$$

recraft: half: แว่นขยายอยู่เหนือกราฟ data lineage ที่แสดงโหนดตารางที่เชื่อมต่อกันพร้อมเครื่องหมายถูก แทนการตรวจสอบ governance

Introduction to Databricks Lakehouse

ขั้นตอนที่ 4: เตรียมพร้อมสำหรับการ deploy

$$

  • ตรวจสอบ Asset Bundle databricks.yml
  • ยืนยันว่า resource ของ nightly job ถูกกำหนดไว้แล้ว
  • ตรวจสอบว่า production target ชี้ไปยัง workspace path ที่ถูกต้อง
  • รัน bundle validate ก่อน deploy

$$

targets:
  production:
    workspace:
      root_path: /Shared/production
resources:
  jobs:
    nightly_sales_etl:
      schedule:
        quartz_cron: "0 0 3 * * ?"
Introduction to Databricks Lakehouse

สรุป

$$

  • Compute: เลือกประเภท cluster ให้ตรงกับ workload (jobs cluster สำหรับงาน automation)
  • Data: ตรวจสอบว่า medallion layers ไหลผ่านได้ถูกต้อง
  • Governance: ติดตาม lineage ตรวจสอบสิทธิ์การเข้าถึง และยืนยันการแชร์ข้อมูล
  • Deployment: ตรวจสอบ Asset Bundle, validate แล้ว deploy
Introduction to Databricks Lakehouse

มาฝึกกันเถอะ!

Introduction to Databricks Lakehouse

Preparing Video For Download...