Вступ до PySpark
Benjamin Schmidt
Data Engineer
Використовував PySpark для машинного навчання, ETL та багато чого іншого
Захоплено навчаю новим інструментам усіх!
-
Розподілена обробка даних: створено для великих наборів даних у кластерах
Підтримує формати даних, зокрема CSV, Parquet і JSON
Інтеграція з SQL дає змогу робити запити як у Python, так і в SQL
Оптимізовано для швидкості на масштабі

Аналітика великих даних
Розподілена обробка даних
Потокова обробка в реальному часі
Машинне навчання на великих наборах даних
Конвеєри ETL та ELT
Працює з різними джерелами даних:


# Import SparkSession
from pyspark.sql import SparkSession
# Initialize a SparkSession
spark = SparkSession.builder.appName("MySparkApp").getOrCreate()
$$
.builder() налаштовує сесіюgetOrCreate() створює або повертає сесію.appName() допомагає керувати кількома сесіями# Import and initialize a Spark session
from pyspark.sql import SparkSession
spark = SparkSession.builder.appName("MySparkApp").getOrCreate()
# Create a DataFrame
census_df = spark.read.csv("census.csv",
["gender","age","zipcode","salary_range_usd","marriage_status"])
# Show the DataFrame
census_df.show()
Вступ до PySpark