डेटा पाइपलाइन्स का परिचय

PySpark के साथ डेटा क्लीनिंग

Mike Metzger

Data Engineering Consultant

डेटा पाइपलाइन क्या है?

  • स्रोतों से अंतिम आउटपुट तक डेटा प्रोसेस करने वाले चरणों का सेट
  • चरणों/कंपोनेंट्स की कोई भी संख्या हो सकती है
  • कई सिस्टम्स में फैला हो सकता है
  • हम Spark के भीतर डेटा पाइपलाइन्स पर ध्यान देंगे
PySpark के साथ डेटा क्लीनिंग

डेटा पाइपलाइन कैसी दिखती है?

  • इनपुट्स
    • CSV, JSON, web services, databases
  • ट्रांसफॉर्मेशंस
    • withColumn(), .filter(), .drop()
  • आउटपुट्स
    • CSV, Parquet, database
  • वैलिडेशन
  • एनालिसिस
PySpark के साथ डेटा क्लीनिंग

पाइपलाइन विवरण

  • Spark में औपचारिक रूप से परिभाषित नहीं है
  • आमतौर पर कार्य के लिए आवश्यक सामान्य Spark कोड ही होता है
    schema = StructType([
    StructField('name', StringType(), False),
    StructField('age', StringType(), False)
    ])
    df = spark.read.format('csv').load('datafile').schema(schema)
    df = df.withColumn('id', monotonically_increasing_id())
    ...
    df.write.parquet('outdata.parquet')
    df.write.json('outdata.json')
    
PySpark के साथ डेटा क्लीनिंग

अभ्यास करते हैं!

PySpark के साथ डेटा क्लीनिंग

Preparing Video For Download...