Kubernetes पर डेटा पाइपलाइन्स

Kubernetes परिचय

Frank Heilmann

Platform Architect and Freelance Instructor

डेटा पाइपलाइन्स क्या हैं?

  • डेटा को मूव, ट्रांसफॉर्म, या विश्लेषित करने की प्रक्रियाओं का सेट
  • सामान्य स्टेप्स:
    • ETL: विभिन्न स्रोतों से डेटा Extract करें, फिर उसे अर्थपूर्ण स्कीमा में Transform करें, अंत में लक्ष्य डेटा सिंक (जैसे, डेटा वेयरहाउस) में Load करें
    • ELT: विभिन्न स्रोतों से डेटा Extract करें, फिर लक्ष्य डेटा सिंक (जैसे, डेटा लेक) में Load करें, अंत में जरूरत पड़ने पर डेटा को अर्थपूर्ण स्कीमा में Transform करें

डेटा पाइपलाइन्स

Kubernetes परिचय

Kubernetes पर डेटा पाइपलाइन्स

  • डेटा पाइपलाइन के स्टेप्स का Kubernetes ऑब्जेक्ट्स से अच्छा मैपिंग होता है:
    • Extract, Transform, Load स्टेप्स: Pods (Deployment या StatefulSet)
    • Extracted और Transformed डेटा: Persistent Volumes
  • Kubernetes जरूरत अनुसार Deployments और Storage स्केल कर सकता है, इसलिए थ्रूपुट बढ़ता है

Kubernetes पर डेटा पाइपलाइन्स

Kubernetes परिचय

डेटा पाइपलाइन्स के लिए ओपन-सोर्स टूल्स

  • बहुत-सा ओपन-सोर्स सॉफ्टवेयर उपलब्ध है जिसे Kubernetes पर सीधे डिप्लॉय किया जा सकता है
  • कुछ उदाहरण:
    • Extract: Apache NiFi, Apache Kafka साथ में Kafka Connect
    • Transform: Apache Spark, Apache Kafka, PostgreSQL
    • Load: Apache Spark, Apache Kafka साथ में KSQL, PostgreSQL
    • PVs के ऊपर स्टोरेज: Minio, Ceph
  • यह सूची पूर्ण नहीं है
Kubernetes परिचय

अभ्यास करते हैं!

Kubernetes परिचय

Preparing Video For Download...