Czyszczenie danych w PySpark
Mike Metzger
Data Engineering Consultant
Czyszczenie danych: Przygotowanie surowych danych do przetwarzania w potokach danych.
Możliwe zadania w procesie czyszczenia danych:
Problemy typowych systemów danych:
Zalety Spark:
Dane surowe:
| imię i nazwisko | wiek (lata) | miasto |
|---|---|---|
| Smith, John | 37 | Dallas |
| Wilson, A. | 59 | Chicago |
| null | 215 |
Dane po czyszczeniu:
| nazwisko | imię | wiek (miesiące) | stan |
|---|---|---|---|
| Smith | John | 444 | TX |
| Wilson | A. | 708 | IL |
Importowanie schematu
import pyspark.sql.types
peopleSchema = StructType([
# Define the name field
StructField('name', StringType(), True),
# Add the age field
StructField('age', IntegerType(), True),
# Add the city field
StructField('city', StringType(), True)
])
Wczytywanie pliku CSV z danymi
people_df = spark.read.format('csv').load(name='rawdata.csv', schema=peopleSchema)
Czyszczenie danych w PySpark