PySpark के साथ डेटा क्लीनिंग
Mike Metzger
Data Engineering Consultant
width, height, image
# This is a comment
200 300 affenpinscher;0
600 450 Collie;307 Collie;101
600 449 Japanese_spaniel;23
उदाहरण रो:
02111277 n02111277_3206 500 375 Newfoundland,110,73,416,298
02108422 n02108422_4375 500 375 bull_mastiff,101,90,214,356 \
bull_mastiff,282,74,416,370
Spark का CSV पार्सर:
df1 = spark.read.csv('datafile.csv.gz', comment='#')
df1 = spark.read.csv('datafile.csv.gz', header='True')
Spark यह करेगा:
sep आर्ग्युमेंट के आधार पर DataFrame में कॉलम अपने-आप बनाएगाdf1 = spark.read.csv('datafile.csv.gz', sep=',')
, यूज़ करता हैsep न हो, तब भी पार्स कर सकता हैdf1 = spark.read.csv('datafile.csv.gz', sep='*')
_c0 नाम के डिफॉल्ट कॉलम में रखता हैPySpark के साथ डेटा क्लीनिंग