सबको एक साथ जोड़ना

Databricks Lakehouse परिचय

Gang Wang

Senior Data Scientist

परिदृश्य

$$

  • आप एक रिटेल कंपनी में नए प्रोजेक्ट पर डेटा इंजीनियर हैं
  • लक्ष्य: compute सेटअप करें, डेटा पाइपलाइन वेरिफाई करें, गवर्नेंस जाँचें, और डिप्लॉयमेंट की तैयारी करें

$$

recraft: half: एक आधुनिक डेस्क पर डेटा इंजीनियर, लैपटॉप पर Databricks-स्टाइल इंटरफेस दिख रहा है, पीछे व्हाइटबोर्ड पर पाइपलाइन डायग्राम, नए डेटा प्रोजेक्ट में ऑनबोर्डिंग को दर्शाता हुआ

Databricks Lakehouse परिचय

चरण 1: सही compute चुनें

$$

  • पाइपलाइन शेड्यूल पर रोज़ रात चलती है
  • इंटरैक्टिव डेवलपमेंट की ज़रूरत नहीं
  • LTS runtime वाला jobs cluster सही विकल्प है
  • बदलती डेटा वॉल्यूम हेतु autoscaling सेट करें (2–6 workers)

$$

All-Purpose Jobs Cluster
Mode Interactive Automated
Management Manual Auto-terminates
Cost Higher (idle time) Cost-optimized
Databricks Lakehouse परिचय

चरण 2: medallion पाइपलाइन वेरिफाई करें

$$

SELECT COUNT(*) FROM bronze_sales;
-- 1,247,832 rows

SELECT COUNT(*) FROM silver_sales;
-- 1,189,456 rows (nulls removed)

SELECT COUNT(*) FROM gold_daily_revenue;
-- 365 rows (daily aggregates)

$$

  • Bronze: raw डेटा, सबसे अधिक rows
  • Silver: cleaned, nulls और duplicates हटे हुए
  • Gold: बिज़नेस रिपोर्टिंग के लिए aggregated
  • क्वालिटी बढ़ते ही row count घटता है
Databricks Lakehouse परिचय

चरण 3: गवर्नेंस जाँचें

$$

  • Unity Catalog पर जाएँ और gold_daily_revenue टेबल देखें
  • अपस्ट्रीम lineage ट्रेस करें कि यह silver_sales से पढ़ती है
  • access controls वेरिफाई करें - gold पर SELECT सिर्फ analytics टीम को हो
  • बाहरी पार्टनर के लिए Delta Sharing कॉन्फ़िगर है, यह कन्फर्म करें

$$

recraft: half: गवर्नेंस वेरिफिकेशन दर्शाते हुए, चेकमार्क वाले कनेक्टेड टेबल नोड्स के साथ डेटा लाइनिएज ग्राफ पर तैरता आवर्धक लेंस

Databricks Lakehouse परिचय

चरण 4: डिप्लॉयमेंट की तैयारी

$$

  • databricks.yml Asset Bundle की समीक्षा करें
  • nightly job resource डिफ़ाइन है, यह कन्फर्म करें
  • जाँचें कि production target सही workspace path पर पॉइंट कर रहा है
  • डिप्लॉय करने से पहले bundle validate चलाएँ

$$

targets:
  production:
    workspace:
      root_path: /Shared/production
resources:
  jobs:
    nightly_sales_etl:
      schedule:
        quartz_cron: "0 0 3 * * ?"
Databricks Lakehouse परिचय

सारांश

$$

  • Compute: वर्कलोड के अनुसार क्लस्टर चुनें (automation के लिए jobs cluster)
  • Data: medallion लेयर्स का फ्लो वेरिफाई करें
  • Governance: lineage ट्रेस करें, access जाँचें, sharing कन्फर्म करें
  • Deployment: Asset Bundle रिव्यू करें, validate करें, डिप्लॉय करें
Databricks Lakehouse परिचय

अभ्यास करते हैं!

Databricks Lakehouse परिचय

Preparing Video For Download...