Основы Big Data с PySpark
Upendra Devisetty
Science Analyst, CyVerse
Apache Spark написан на Scala
Для поддержки Python сообщество Apache Spark выпустило PySpark
Скорость и мощь вычислений сопоставимы со Scala
API PySpark схожи с Pandas и Scikit-learn
Интерактивная среда для выполнения заданий Spark
Удобна для быстрого интерактивного прототипирования
Оболочки Spark позволяют работать с данными на диске и в памяти
Доступны три оболочки Spark:
Spark-shell для Scala
PySpark-shell для Python
SparkR для R
Оболочка PySpark — инструмент командной строки на основе Python
Позволяет специалистам по данным работать со структурами данных Spark
Поддерживает подключение к кластеру
SparkContext — точка входа в мир Spark
Точка входа — это способ подключения к кластеру Spark
Точка входа — как ключ от дома
В PySpark есть SparkContext по умолчанию — sc
sc.version
2.3.1
sc.pythonVer
3.6
sc.master
local[*]
parallelize() объекта SparkContextrdd = sc.parallelize([1,2,3,4,5])
textFile() объекта SparkContextrdd2 = sc.textFile("test.txt")
Основы Big Data с PySpark