PySpark ve velkém měřítku

Introduction to PySpark

Benjamin Schmidt

Data Engineer

Využití velkého měřítka

  • PySpark efektivně zpracovává gigabajty i terabajty dat
  • Cílem je rychlost a efektivní zpracování
  • Pochopení spouštění PySparku přináší další úspory
  • Použijte broadcast pro správu celého clusteru
joined_df = large_df.join(broadcast(small_df), 
                          on="key_column", how="inner")
joined_df.show()
Introduction to PySpark

Plány spouštění

# Using explain() to view the execution plan
df.filter(df.Age > 40).select("Name").explain()
== Physical Plan ==
*(1) Filter (isnotnull(Age) AND (Age > 30))
+- Scan ExistingRDD[Name:String, Age:Int]
1 https://spark.apache.org/docs/latest/api/python/reference/pyspark.sql/api/pyspark.sql.DataFrame.explain.html
Introduction to PySpark

Caching a persisting DataFramů

  • Caching: Ukládá data do paměti pro rychlejší přístup u menších datasetů
  • Persisting: Ukládá data na různých úrovních úložiště pro větší datasety
df = spark.read.csv("large_dataset.csv", header=True, inferSchema=True)

# Cache the DataFrame
df.cache()

# Perform multiple operations on the cached DataFrame df.filter(df["column1"] > 50).show() df.groupBy("column2").count().show()
Introduction to PySpark

Persisting DataFramů s různými úrovněmi úložiště

# Persist the DataFrame with storage level
from pyspark import StorageLevel

df.persist(StorageLevel.MEMORY_AND_DISK)

# Perform transformations result = df.groupBy("column3").agg({"column4": "sum"}) result.show() # Unpersist after use df.unpersist()
Introduction to PySpark

Optimalizace PySparku

  • Malé podmnožiny: Čím více dat, tím pomalejší operace – preferujte map() před groupby() kvůli selektivitě metod
  • Broadcast joiny: Broadcast využije veškerou výpočetní kapacitu, i na menších datasetech
  • Vyhněte se opakovaným akcím: Opakované akce nad stejnými daty plýtvají časem i výpočetními zdroji
Introduction to PySpark

Lass uns üben!

Introduction to PySpark

Preparing Video For Download...