PySpark: Spark з Python

Основи Big Data з PySpark

Upendra Devisetty

Science Analyst, CyVerse

Огляд PySpark

  • Apache Spark написано мовою Scala

  • Щоб підтримати Python у Spark, спільнота Apache Spark випустила PySpark

  • Швидкість і потужність обчислень подібні до Scala

  • API PySpark схожі на Pandas і Scikit-learn

Основи Big Data з PySpark

Що таке Spark shell?

  • Інтерактивне середовище для запуску завдань Spark

  • Корисне для швидкого інтерактивного прототипування

  • Оболонки Spark дають змогу працювати з даними на диску чи в пам'яті

  • Є три оболонки Spark:

    • Spark-shell для Scala

    • PySpark-shell для Python

    • SparkR для R

Основи Big Data з PySpark

Оболонка PySpark

  • Оболонка PySpark — це інструмент командного рядка на основі Python

  • Вона дозволяє дата-сайєнтистам працювати зі структурами даних Spark

  • Оболонка PySpark підтримує підключення до кластера

Основи Big Data з PySpark

Розуміння SparkContext

  • SparkContext — це точка входу у світ Spark

  • Точка входу — спосіб під'єднатися до кластера Spark

  • Точка входу — як ключ від дому

  • У PySpark є типовий SparkContext sc

1 https://www.datacamp.com/cheat-sheet/pyspark-cheat-sheet-spark-in-python
Основи Big Data з PySpark

Інспектування SparkContext

  • Version: щоб отримати версію SparkContext
sc.version
2.3.1
  • Python Version: щоб дізнатися версію Python у SparkContext
sc.pythonVer
3.6
  • Master: URL кластера або локальний рядок для запуску в локальному режимі SparkContext
sc.master
local[*]
1 https://www.datacamp.com/cheat-sheet/pyspark-cheat-sheet-spark-in-python
Основи Big Data з PySpark

Завантаження даних у PySpark

  • Метод parallelize() у SparkContext
rdd = sc.parallelize([1,2,3,4,5])
  • Метод textFile() у SparkContext
rdd2 = sc.textFile("test.txt")
1 https://www.datacamp.com/cheat-sheet/pyspark-cheat-sheet-spark-in-python
Основи Big Data з PySpark

Давайте потренуємось

Основи Big Data з PySpark

Preparing Video For Download...