Введение в PySpark

Введение в PySpark

Benjamin Schmidt

Data Engineer

Ваш преподаватель

  • Почти десять лет работы с данными и PySpark
  • Применял PySpark для машинного обучения, ETL-задач и многого другого

  • Увлечённый преподаватель новых инструментов!

-Ben Schmidt

Введение в PySpark

Что такое PySpark?

  • Распределённая обработка данных: предназначена для работы с большими наборами данных в кластерах

  • Поддерживает различные форматы данных: CSV, Parquet и JSON

  • Интеграция с SQL позволяет запрашивать данные на Python и SQL

  • Оптимизирован для высокой скорости на больших объёмах

Data_ecosystem

Введение в PySpark

Когда используют PySpark?

  • Аналитика больших данных

  • Распределённая обработка данных

  • Потоковая обработка данных в реальном времени

  • Машинное обучение на больших наборах данных

  • ETL и ELT-конвейеры

  • Работа с различными источниками данных:

    1. CSV
    2. JSON
    3. Parquet
    4. И многими другими
Введение в PySpark

Кластер Spark

Мастер-узел

  • Управляет кластером, координирует задачи и планирует их выполнение

Рабочие узлы

  • Выполняют задачи, назначенные мастером
  • Отвечают за вычисления и хранение данных в памяти или на диске

Мастер-узел

Рабочий узел

Введение в PySpark

SparkSession

  • SparkSession открывает доступ к кластеру Spark и необходима для работы с PySpark.
# Import SparkSession
from pyspark.sql import SparkSession

# Initialize a SparkSession
spark = SparkSession.builder.appName("MySparkApp").getOrCreate()

$$

  • .builder() настраивает сессию
  • getOrCreate() создаёт или возвращает существующую сессию
  • .appName() помогает управлять несколькими сессиями
Введение в PySpark

DataFrame в PySpark

  • Похожи на обычные DataFrame, но
  • Оптимизированы для PySpark
# Import and initialize a Spark session
from pyspark.sql import SparkSession
spark = SparkSession.builder.appName("MySparkApp").getOrCreate()

# Create a DataFrame
census_df = spark.read.csv("census.csv",
                ["gender","age","zipcode","salary_range_usd","marriage_status"])

# Show the DataFrame
census_df.show()

Введение в PySpark

Давайте потренируемся!

Введение в PySpark

Preparing Video For Download...