PySpark: Spark med Python

Grunderna i Big Data med PySpark

Upendra Devisetty

Science Analyst, CyVerse

Översikt av PySpark

  • Apache Spark är skrivet i Scala

  • För att stödja Python lanserade Apache Spark Community PySpark

  • Likvärdig beräkningshastighet och kapacitet som Scala

  • PySparks API:er liknar Pandas och Scikit-learn

Grunderna i Big Data med PySpark

Vad är Spark shell?

  • Interaktiv miljö för att köra Spark-jobb

  • Användbar för snabb interaktiv prototypning

  • Spark-skal möjliggör interaktion med data på disk eller i minnet

  • Tre olika Spark-skal:

    • Spark-shell för Scala

    • PySpark-shell för Python

    • SparkR för R

Grunderna i Big Data med PySpark

PySpark-skalet

  • PySpark-skalet är ett Python-baserat kommandoradsverktyg

  • PySpark-skalet låter datavetare interagera med Sparks datastrukturer

  • PySpark-skalet stöder anslutning till ett kluster

Grunderna i Big Data med PySpark

Förstå SparkContext

  • SparkContext är ingångspunkten till Sparks värld

  • En ingångspunkt är sättet att ansluta till ett Spark-kluster

  • En ingångspunkt fungerar som en nyckel till huset

  • PySpark har en standardmässig SparkContext som heter sc

1 https://www.datacamp.com/cheat-sheet/pyspark-cheat-sheet-spark-in-python
Grunderna i Big Data med PySpark

Granska SparkContext

  • Version: Hämta SparkContext-versionen
sc.version
2.3.1
  • Python-version: Hämta Python-versionen för SparkContext
sc.pythonVer
3.6
  • Master: URL till klustret eller lokal sträng för att köra SparkContext i lokalt läge
sc.master
local[*]
1 https://www.datacamp.com/cheat-sheet/pyspark-cheat-sheet-spark-in-python
Grunderna i Big Data med PySpark

Läsa in data i PySpark

  • SparkContexts parallelize()-metod
rdd = sc.parallelize([1,2,3,4,5])
  • SparkContexts textFile()-metod
rdd2 = sc.textFile("test.txt")
1 https://www.datacamp.com/cheat-sheet/pyspark-cheat-sheet-spark-in-python
Grunderna i Big Data med PySpark

Nu kör vi en övning!

Grunderna i Big Data med PySpark

Preparing Video For Download...