PySpark के साथ डेटा क्लीनिंग
Mike Metzger
Data Engineering Consultant
Spark Clusters दो प्रकार की प्रक्रियाओं से बने होते हैं
महत्वपूर्ण पैरामीटर्स:
airport_df = spark.read.csv('airports-*.txt.gz')
अच्छी तरह परिभाषित स्कीमा इम्पोर्ट परफॉर्मेंस को बहुत बढ़ाता है
split -l 10000 -d largefile chunk-
df_csv = spark.read.csv('singlelargefile.csv')
df_csv.write.parquet('data.parquet')
df = spark.read.parquet('data.parquet')
PySpark के साथ डेटा क्लीनिंग