Introducere în curățarea datelor cu Apache Spark

Curățarea datelor cu PySpark

Mike Metzger

Data Engineering Consultant

Ce este curățarea datelor?

Curățarea datelor: pregătirea datelor brute pentru utilizarea în fluxuri de procesare.

Sarcini posibile de curățare a datelor:

  • Reformatarea sau înlocuirea textului
  • Efectuarea calculelor
  • Eliminarea datelor incomplete sau eronate
Curățarea datelor cu PySpark

De ce să curățați datele cu Spark?

Probleme ale sistemelor tipice de date:

  • Performanță
  • Organizarea fluxului de date

Avantajele Spark:

  • Scalabil
  • Framework puternic pentru gestionarea datelor
Curățarea datelor cu PySpark

Exemplu de curățare a datelor

Date brute:

nume vârstă (ani) oraș
Smith, John 37 Dallas
Wilson, A. 59 Chicago
null 215

Date curățate:

nume de familie prenume vârstă (luni) stat
Smith John 444 TX
Wilson A. 708 IL
Curățarea datelor cu PySpark

Scheme Spark

  • Definesc formatul unui DataFrame
  • Pot conține diverse tipuri de date:
    • Șiruri, date, numere întregi, array-uri
  • Permit filtrarea datelor eronate la import
  • Îmbunătățesc performanța la citire
Curățarea datelor cu PySpark

Exemplu de schemă Spark

Importați schema

import pyspark.sql.types
peopleSchema = StructType([
  # Define the name field
  StructField('name', StringType(), True),
  # Add the age field
  StructField('age', IntegerType(), True),
  # Add the city field
  StructField('city', StringType(), True)  
])

Citiți fișierul CSV cu date

people_df = spark.read.format('csv').load(name='rawdata.csv', schema=peopleSchema)
Curățarea datelor cu PySpark

Să exersăm!

Curățarea datelor cu PySpark

Preparing Video For Download...