Úvod do čištění dat s Apache Spark

Cleaning Data with PySpark

Mike Metzger

Data Engineering Consultant

Co je čištění dat?

Čištění dat: Příprava surových dat pro zpracování v datových pipeline.

Možné úkoly při čištění dat:

  • Přeformátování nebo nahrazování textu
  • Provádění výpočtů
  • Odstraňování neplatných nebo neúplných dat
Cleaning Data with PySpark

Proč čistit data pomocí Sparku?

Problémy běžných datových systémů:

  • Výkon
  • Organizace datového toku

Výhody Sparku:

  • Škálovatelnost
  • Výkonný framework pro práci s daty
Cleaning Data with PySpark

Příklad čištění dat

Surová data:

jméno věk (roky) město
Smith, John 37 Dallas
Wilson, A. 59 Chicago
null 215

Vyčištěná data:

příjmení jméno věk (měsíce) stát
Smith John 444 TX
Wilson A. 708 IL
Cleaning Data with PySpark

Schémata Sparku

  • Definuje formát DataFrame
  • Může obsahovat různé datové typy:
    • Řetězce, data, celá čísla, pole
  • Umožňuje filtrovat neplatná data při importu
  • Zlepšuje výkon čtení
Cleaning Data with PySpark

Příklad schématu Spark

Import schématu

import pyspark.sql.types
peopleSchema = StructType([
  # Define the name field
  StructField('name', StringType(), True),
  # Add the age field
  StructField('age', IntegerType(), True),
  # Add the city field
  StructField('city', StringType(), True)  
])

Načtení CSV souboru s daty

people_df = spark.read.format('csv').load(name='rawdata.csv', schema=peopleSchema)
Cleaning Data with PySpark

Pojďme cvičit!

Cleaning Data with PySpark

Preparing Video For Download...