PySpark: Spark s Pythonem

Big Data Fundamentals with PySpark

Upendra Devisetty

Science Analyst, CyVerse

Přehled PySparku

  • Apache Spark je napsán ve Scale

  • Pro podporu Pythonu vydala komunita Apache Spark PySpark

  • Srovnatelná rychlost a výkon jako Scala

  • API PySparku jsou podobná Pandas a Scikit-learn

Big Data Fundamentals with PySpark

Co je Spark shell?

  • Interaktivní prostředí pro spouštění úloh Spark

  • Vhodné pro rychlé interaktivní prototypování

  • Spark shell umožňuje práci s daty na disku i v paměti

  • Tři různá prostředí Spark shell:

    • Spark-shell pro Scala

    • PySpark-shell pro Python

    • SparkR pro R

Big Data Fundamentals with PySpark

PySpark shell

  • PySpark shell je nástroj příkazové řádky založený na Pythonu

  • PySpark shell umožňuje datovým vědcům pracovat se strukturami dat Spark

  • PySpark shell podporuje připojení ke clusteru

Big Data Fundamentals with PySpark

Princip SparkContext

  • SparkContext je vstupní bod do světa Spark

  • Vstupní bod slouží k připojení ke clusteru Spark

  • Vstupní bod je jako klíč od domu

  • PySpark má výchozí SparkContext s názvem sc

1 https://www.datacamp.com/cheat-sheet/pyspark-cheat-sheet-spark-in-python
Big Data Fundamentals with PySpark

Inspekce SparkContext

  • Verze: Získání verze SparkContext
sc.version
2.3.1
  • Verze Pythonu: Získání verze Pythonu SparkContext
sc.pythonVer
3.6
  • Master: URL clusteru nebo řetězec pro lokální režim SparkContext
sc.master
local[*]
1 https://www.datacamp.com/cheat-sheet/pyspark-cheat-sheet-spark-in-python
Big Data Fundamentals with PySpark

Načítání dat v PySparku

  • Metoda parallelize() třídy SparkContext
rdd = sc.parallelize([1,2,3,4,5])
  • Metoda textFile() třídy SparkContext
rdd2 = sc.textFile("test.txt")
1 https://www.datacamp.com/cheat-sheet/pyspark-cheat-sheet-spark-in-python
Big Data Fundamentals with PySpark

Vyzkoušejte si to

Big Data Fundamentals with PySpark

Preparing Video For Download...