Apache Spark के साथ डेटा क्लीनिंग परिचय

PySpark के साथ डेटा क्लीनिंग

Mike Metzger

Data Engineering Consultant

Data Cleaning क्या है?

डेटा क्लीनिंग: डेटा प्रोसेसिंग पाइपलाइनों में उपयोग के लिए कच्चे डेटा को तैयार करना.

डेटा क्लीनिंग में संभावित कार्य:

  • टेक्स्ट को फिर से फॉर्मेट करना या बदलना
  • कैलकुलेशन करना
  • बेकार या अधूरा डेटा हटाना
PySpark के साथ डेटा क्लीनिंग

Spark के साथ डेटा क्लीनिंग क्यों करें?

आम डेटा सिस्टम की समस्याएँ:

  • परफॉर्मेंस
  • डेटा फ्लो को ऑर्गनाइज़ करना

Spark के फायदे:

  • स्केलेबल
  • डेटा हैंडलिंग के लिए पावरफुल फ्रेमवर्क
PySpark के साथ डेटा क्लीनिंग

डेटा क्लीनिंग उदाहरण

कच्चा डेटा:

name age (years) city
Smith, John 37 Dallas
Wilson, A. 59 Chicago
null 215

क्लीन किया हुआ डेटा:

last name first name age (months) state
Smith John 444 TX
Wilson A. 708 IL
PySpark के साथ डेटा क्लीनिंग

Spark Schemas

  • DataFrame का फ़ॉर्मेट परिभाषित करें
  • कई डेटा टाइप हो सकते हैं:
    • स्ट्रिंग, डेट, इंटीजर, एरे
  • इम्पोर्ट के दौरान बेकार डेटा फ़िल्टर कर सकते हैं
  • रीड परफॉर्मेंस बेहतर होती है
PySpark के साथ डेटा क्लीनिंग

Spark Schema उदाहरण

स्कीमा इम्पोर्ट करें

import pyspark.sql.types
peopleSchema = StructType([
  # Define the name field
  StructField('name', StringType(), True),
  # Add the age field
  StructField('age', IntegerType(), True),
  # Add the city field
  StructField('city', StringType(), True)  
])

डेटा वाला CSV फ़ाइल पढ़ें

people_df = spark.read.format('csv').load(name='rawdata.csv', schema=peopleSchema)
PySpark के साथ डेटा क्लीनिंग

अभ्यास करते हैं!

PySpark के साथ डेटा क्लीनिंग

Preparing Video For Download...