PySpark के साथ डेटा क्लीनिंग
Mike Metzger
Data Engineering Consultant
Parquet फाइलें पढ़ना
df = spark.read.format('parquet').load('filename.parquet')
df = spark.read.parquet('filename.parquet')
Parquet फाइलें लिखना
df.write.format('parquet').save('filename.parquet')
df.write.parquet('filename.parquet')
SparkSQL ऑपरेशंस के लिए Parquet को बैकिंग स्टोर के रूप में
flight_df = spark.read.parquet('flights.parquet')
flight_df.createOrReplaceTempView('flights')
short_flights_df = spark.sql('SELECT * FROM flights WHERE flightduration < 100')
PySpark के साथ डेटा क्लीनिंग