Wprowadzenie do czyszczenia danych z Apache Spark

Czyszczenie danych w PySpark

Mike Metzger

Data Engineering Consultant

Czym jest czyszczenie danych?

Czyszczenie danych: Przygotowanie surowych danych do przetwarzania w potokach danych.

Możliwe zadania w procesie czyszczenia danych:

  • Formatowanie lub zastępowanie tekstu
  • Wykonywanie obliczeń
  • Usuwanie błędnych lub niekompletnych danych
Czyszczenie danych w PySpark

Dlaczego czyścić dane za pomocą Spark?

Problemy typowych systemów danych:

  • Wydajność
  • Organizacja przepływu danych

Zalety Spark:

  • Skalowalność
  • Zaawansowane narzędzia do obsługi danych
Czyszczenie danych w PySpark

Przykład czyszczenia danych

Dane surowe:

imię i nazwisko wiek (lata) miasto
Smith, John 37 Dallas
Wilson, A. 59 Chicago
null 215

Dane po czyszczeniu:

nazwisko imię wiek (miesiące) stan
Smith John 444 TX
Wilson A. 708 IL
Czyszczenie danych w PySpark

Schematy Spark

  • Definiuje format DataFrame
  • Może zawierać różne typy danych:
    • Ciągi znaków, daty, liczby całkowite, tablice
  • Umożliwia filtrowanie błędnych danych podczas importu
  • Poprawia wydajność odczytu
Czyszczenie danych w PySpark

Przykładowy schemat Spark

Importowanie schematu

import pyspark.sql.types
peopleSchema = StructType([
  # Define the name field
  StructField('name', StringType(), True),
  # Add the age field
  StructField('age', IntegerType(), True),
  # Add the city field
  StructField('city', StringType(), True)  
])

Wczytywanie pliku CSV z danymi

people_df = spark.read.format('csv').load(name='rawdata.csv', schema=peopleSchema)
Czyszczenie danych w PySpark

Czas na ćwiczenia!

Czyszczenie danych w PySpark

Preparing Video For Download...