डेटा को मूव, ट्रांसफॉर्म, या विश्लेषित करने की प्रक्रियाओं का सेट
सामान्य स्टेप्स:
ETL: विभिन्न स्रोतों से डेटा Extract करें,
फिर उसे अर्थपूर्ण स्कीमा में Transform करें,
अंत में लक्ष्य डेटा सिंक (जैसे, डेटा वेयरहाउस) में Load करें
ELT: विभिन्न स्रोतों से डेटा Extract करें,
फिर लक्ष्य डेटा सिंक (जैसे, डेटा लेक) में Load करें,
अंत में जरूरत पड़ने पर डेटा को अर्थपूर्ण स्कीमा में Transform करें
Kubernetes पर डेटा पाइपलाइन्स
डेटा पाइपलाइन के स्टेप्स का Kubernetes ऑब्जेक्ट्स से अच्छा मैपिंग होता है:
Extract, Transform, Load स्टेप्स: Pods (Deployment या StatefulSet)
Extracted और Transformed डेटा: Persistent Volumes
Kubernetes जरूरत अनुसार Deployments और Storage स्केल कर सकता है, इसलिए थ्रूपुट बढ़ता है
डेटा पाइपलाइन्स के लिए ओपन-सोर्स टूल्स
बहुत-सा ओपन-सोर्स सॉफ्टवेयर उपलब्ध है जिसे Kubernetes पर सीधे डिप्लॉय किया जा सकता है
कुछ उदाहरण:
Extract: Apache NiFi, Apache Kafka साथ में Kafka Connect
Transform: Apache Spark, Apache Kafka, PostgreSQL
Load: Apache Spark, Apache Kafka साथ में KSQL, PostgreSQL