Введение в PySpark
Benjamin Schmidt
Data Engineer
Применял PySpark для машинного обучения, ETL-задач и многого другого
Увлечённый преподаватель новых инструментов!
-
Распределённая обработка данных: предназначена для работы с большими наборами данных в кластерах
Поддерживает различные форматы данных: CSV, Parquet и JSON
Интеграция с SQL позволяет запрашивать данные на Python и SQL
Оптимизирован для высокой скорости на больших объёмах

Аналитика больших данных
Распределённая обработка данных
Потоковая обработка данных в реальном времени
Машинное обучение на больших наборах данных
ETL и ELT-конвейеры
Работа с различными источниками данных:


# Import SparkSession
from pyspark.sql import SparkSession
# Initialize a SparkSession
spark = SparkSession.builder.appName("MySparkApp").getOrCreate()
$$
.builder() настраивает сессиюgetOrCreate() создаёт или возвращает существующую сессию.appName() помогает управлять несколькими сессиями# Import and initialize a Spark session
from pyspark.sql import SparkSession
spark = SparkSession.builder.appName("MySparkApp").getOrCreate()
# Create a DataFrame
census_df = spark.read.csv("census.csv",
["gender","age","zipcode","salary_range_usd","marriage_status"])
# Show the DataFrame
census_df.show()
Введение в PySpark