PySpark: Spark z Pythonem

Podstawy Big Data z PySpark

Upendra Devisetty

Science Analyst, CyVerse

Przegląd PySpark

  • Apache Spark jest napisany w języku Scala

  • Aby obsługiwać Pythona ze Sparkiem, społeczność Apache Spark udostępniła PySpark

  • Podobna szybkość i moc obliczeniowa jak w Scali

  • API PySpark jest podobne do Pandas i Scikit-learn

Podstawy Big Data z PySpark

Czym jest powłoka Spark?

  • Interaktywne środowisko do uruchamiania zadań Spark

  • Przydatne do szybkiego prototypowania interaktywnego

  • Powłoki Spark umożliwiają pracę z danymi na dysku lub w pamięci

  • Trzy różne powłoki Spark:

    • Spark-shell dla Scali

    • PySpark-shell dla Pythona

    • SparkR dla R

Podstawy Big Data z PySpark

Powłoka PySpark

  • Powłoka PySpark to narzędzie wiersza poleceń oparte na Pythonie

  • Powłoka PySpark umożliwia naukowcom danych pracę ze strukturami danych Spark

  • Powłoka PySpark obsługuje łączenie z klastrem

Podstawy Big Data z PySpark

Wprowadzenie do SparkContext

  • SparkContext jest punktem wejścia do świata Spark

  • Punkt wejścia to sposób łączenia się z klastrem Spark

  • Punkt wejścia działa jak klucz do domu

  • PySpark ma domyślny SparkContext o nazwie sc

1 https://www.datacamp.com/cheat-sheet/pyspark-cheat-sheet-spark-in-python
Podstawy Big Data z PySpark

Inspekcja SparkContext

  • Wersja: Pobranie wersji SparkContext
sc.version
2.3.1
  • Wersja Pythona: Pobranie wersji Pythona SparkContext
sc.pythonVer
3.6
  • Master: URL klastra lub ciąg local do uruchomienia w trybie lokalnym SparkContext
sc.master
local[*]
1 https://www.datacamp.com/cheat-sheet/pyspark-cheat-sheet-spark-in-python
Podstawy Big Data z PySpark

Ładowanie danych w PySpark

  • Metoda parallelize() SparkContext
rdd = sc.parallelize([1,2,3,4,5])
  • Metoda textFile() SparkContext
rdd2 = sc.textFile("test.txt")
1 https://www.datacamp.com/cheat-sheet/pyspark-cheat-sheet-spark-in-python
Podstawy Big Data z PySpark

Czas na ćwiczenia

Podstawy Big Data z PySpark

Preparing Video For Download...