Introduktion till datarensning med Apache Spark

Datarensning med PySpark

Mike Metzger

Data Engineering Consultant

Vad är datarensning?

Datarensning: Förbereder rådata för användning i databearbetningspipelines.

Vanliga uppgifter vid datarensning:

  • Omformatera eller ersätta text
  • Utföra beräkningar
  • Ta bort felaktig eller ofullständig data
Datarensning med PySpark

Varför rensa data med Spark?

Problem med typiska datasystem:

  • Prestanda
  • Organisering av dataflöde

Fördelar med Spark:

  • Skalbart
  • Kraftfullt ramverk för datahantering
Datarensning med PySpark

Exempel på datarensning

Rådata:

namn ålder (år) stad
Smith, John 37 Dallas
Wilson, A. 59 Chicago
null 215

Rensad data:

efternamn förnamn ålder (månader) delstat
Smith John 444 TX
Wilson A. 708 IL
Datarensning med PySpark

Spark-scheman

  • Definierar formatet för en DataFrame
  • Kan innehålla olika datatyper:
    • Strängar, datum, heltal, arrayer
  • Kan filtrera bort felaktig data vid inläsning
  • Förbättrar läsprestanda
Datarensning med PySpark

Exempel på Spark-schema

Importera schema

import pyspark.sql.types
peopleSchema = StructType([
  # Define the name field
  StructField('name', StringType(), True),
  # Add the age field
  StructField('age', IntegerType(), True),
  # Add the city field
  StructField('city', StringType(), True)  
])

Läs CSV-fil med data

people_df = spark.read.format('csv').load(name='rawdata.csv', schema=peopleSchema)
Datarensning med PySpark

Nu kör vi en övning!

Datarensning med PySpark

Preparing Video For Download...