PySpark: Spark и Python

Основы Big Data с PySpark

Upendra Devisetty

Science Analyst, CyVerse

Обзор PySpark

  • Apache Spark написан на Scala

  • Для поддержки Python сообщество Apache Spark выпустило PySpark

  • Скорость и мощь вычислений сопоставимы со Scala

  • API PySpark схожи с Pandas и Scikit-learn

Основы Big Data с PySpark

Что такое оболочка Spark?

  • Интерактивная среда для выполнения заданий Spark

  • Удобна для быстрого интерактивного прототипирования

  • Оболочки Spark позволяют работать с данными на диске и в памяти

  • Доступны три оболочки Spark:

    • Spark-shell для Scala

    • PySpark-shell для Python

    • SparkR для R

Основы Big Data с PySpark

Оболочка PySpark

  • Оболочка PySpark — инструмент командной строки на основе Python

  • Позволяет специалистам по данным работать со структурами данных Spark

  • Поддерживает подключение к кластеру

Основы Big Data с PySpark

Знакомство со SparkContext

  • SparkContext — точка входа в мир Spark

  • Точка входа — это способ подключения к кластеру Spark

  • Точка входа — как ключ от дома

  • В PySpark есть SparkContext по умолчанию — sc

1 https://www.datacamp.com/cheat-sheet/pyspark-cheat-sheet-spark-in-python
Основы Big Data с PySpark

Исследование SparkContext

  • Версия: получить версию SparkContext
sc.version
2.3.1
  • Версия Python: получить версию Python для SparkContext
sc.pythonVer
3.6
  • Master: URL кластера или строка local для запуска SparkContext в локальном режиме
sc.master
local[*]
1 https://www.datacamp.com/cheat-sheet/pyspark-cheat-sheet-spark-in-python
Основы Big Data с PySpark

Загрузка данных в PySpark

  • Метод parallelize() объекта SparkContext
rdd = sc.parallelize([1,2,3,4,5])
  • Метод textFile() объекта SparkContext
rdd2 = sc.textFile("test.txt")
1 https://www.datacamp.com/cheat-sheet/pyspark-cheat-sheet-spark-in-python
Основы Big Data с PySpark

Давайте потренируемся!

Основы Big Data с PySpark

Preparing Video For Download...