Основи Big Data з PySpark
Upendra Devisetty
Science Analyst, CyVerse
Apache Spark написано мовою Scala
Щоб підтримати Python у Spark, спільнота Apache Spark випустила PySpark
Швидкість і потужність обчислень подібні до Scala
API PySpark схожі на Pandas і Scikit-learn
Інтерактивне середовище для запуску завдань Spark
Корисне для швидкого інтерактивного прототипування
Оболонки Spark дають змогу працювати з даними на диску чи в пам'яті
Є три оболонки Spark:
Spark-shell для Scala
PySpark-shell для Python
SparkR для R
Оболонка PySpark — це інструмент командного рядка на основі Python
Вона дозволяє дата-сайєнтистам працювати зі структурами даних Spark
Оболонка PySpark підтримує підключення до кластера
SparkContext — це точка входу у світ Spark
Точка входу — спосіб під'єднатися до кластера Spark
Точка входу — як ключ від дому
У PySpark є типовий SparkContext sc
sc.version
2.3.1
sc.pythonVer
3.6
sc.master
local[*]
parallelize() у SparkContextrdd = sc.parallelize([1,2,3,4,5])
textFile() у SparkContextrdd2 = sc.textFile("test.txt")
Основи Big Data з PySpark