Data Intelligence Platform - Compute

Databricks परिचय

Kevin Barlow

Data Practitioner

संगठन compute की परवाह क्यों करते हैं?

एकल कॉग

कॉग्स की प्रणाली

Databricks परिचय

Apache Spark

  • Databricks के सह-संस्थापकों द्वारा बनाया गया
  • ओपन-सोर्स फ़्रेमवर्क
  • अत्यधिक कुशल distributed computing
  • Python, SQL, Scala, R के लिए APIs
  • लगभग हर use case के लिए उपयुक्त:
    • data engineering से machine learning और business intelligence तक

DataCamp पर कुछ Apache Spark courses देखें!

Apache Spark Logo

Databricks परिचय

क्लस्टर प्रकार

Classic

  • Compute संसाधन (virtual machines) Compute Plane में बनाए जाते हैं
  • Databricks आपके क्लाउड के लिए कॉन्फ़िगरेशन प्रदान करता है
  • Pros: compute और सुरक्षा आपके environment में, मौजूदा compute pools का लाभ, आदि
  • Cons: startup समय धीमा

Databricks Control Plane

Databricks परिचय

क्लस्टर प्रकार

Serverless

  • Compute संसाधन (virtual machines) Control Plane में बनाए जाते हैं
  • Databricks आपके यूज़र्स को एक्सेस देता है
  • Pros: तेज startup, नवीनतम फीचर्स, सबसे तेज प्रदर्शन, Databricks समय के साथ प्रदर्शन बेहतर करता है
  • Cons(?): compute आपके environment में नहीं

Serverless Architecture

Databricks परिचय

Single-node बनाम Multi-node

Single-node

  • केवल एक Driver Node वाला क्लस्टर
  • फिर भी Spark चला सकते हैं
  • single-node फ़्रेमवर्क (जैसे, pandas) भी चला सकते हैं
  • छोटे datasets के लिए बढ़िया

Single-node cluster

Multi-node

  • एक Driver Node और एक या अधिक Worker Nodes वाला क्लस्टर
  • Spark कई nodes में कार्य वितरित कर सकता है
  • बड़े datasets के लिए बढ़िया

Multi-node cluster

Databricks परिचय

Databricks Runtime

  • हर Databricks क्लस्टर पर इंस्टॉल
    • Apache Spark का optimized संस्करण
    • तेज SQL queries के लिए Photon
    • सामान्य लाइब्रेरियाँ (जैसे, pandas, dplyr, scikit-learn)
    • Databricks सेवाओं से कनेक्ट करने की logic

सामान्य सिफारिश: Runtime का नवीनतम Long Term Support (LTS) संस्करण उपयोग करें

Cluster with Databricks Runtime

Databricks परिचय

अभ्यास करते हैं!

Databricks परिचय

Preparing Video For Download...