Neměnnost a líné zpracování

Cleaning Data with PySpark

Mike Metzger

Data Engineering Consultant

Přehled proměnných

Proměnné v Pythonu:

  • Měnitelné
  • Flexibilita
  • Potenciální problémy s konkurencí
  • Zvyšuje složitost
Cleaning Data with PySpark

Neměnnost

Neměnné proměnné:

  • Součást funkcionálního programování
  • Definovány jednou
  • Nelze je přímo upravit
  • Při přiřazení se vytvoří znovu
  • Lze je efektivně sdílet
Cleaning Data with PySpark

Příklad neměnnosti

Definice nového datového rámce:

voter_df = spark.read.csv('voterdata.csv')

Provádění změn:

voter_df = voter_df.withColumn('fullyear', 
    voter_df.year + 2000)

voter_df = voter_df.drop(voter_df.year)
Cleaning Data with PySpark

Líné zpracování

  • Není to pomalé?
  • Transformace
  • Akce
  • Umožňuje efektivní plánování
voter_df = voter_df.withColumn('fullyear', 
    voter_df.year + 2000)
voter_df = voter_df.drop(voter_df.year)

voter_df.count()
Cleaning Data with PySpark

Pojďme cvičit!

Cleaning Data with PySpark

Preparing Video For Download...