Вступ до PySpark
Benjamin Schmidt
Data Engineer
spark.read.csv("path/to/file.csv")
spark.read.json("path/to/file.json")
spark.read.parquet("path/to/file.parquet")
Spark може виводити схеми з даних за допомогою inferSchema=True
Визначайте схему вручну для кращого контролю — корисно для фіксованих структур

IntegerType: цілі числа1, 3478, -18904569223347758063.14159"This is an example of a string."# Імпортуйте необхідні типи як класи
from pyspark.sql.types import (StructType,
StructField, IntegerType,
StringType, ArrayType)
# Створіть схему
schema = StructType([
StructField("id", IntegerType(), True),
StructField("name", StringType(), True),
StructField("scores", ArrayType(IntegerType()), True)
])
# Задайте схему
df = spark.createDataFrame(data, schema=schema)
.select() для вибору колонок.filter() або .where() для фільтрації рядків за умовами.sort() для сортування за кількома колонками# Виберіть і покажіть лише колонки name та age
df.select("name", "age").show()
# Фільтруйте за age > 30
df.filter(df["age"] > 30).show()
# Використайте where для точного значення
df.where(df["age"] == 30).show()
# Сортуйте за age
df.sort("age", ascending=False).show()
.sort() або .orderBy()na.drop() для видалення рядків із null-значеннями# Сортування за колонкою age
df.sort("age", ascending=False).show()
# Видаліть пропущені значення
df.na.drop().show()
spark.read_json(): завантаження даних з JSONspark.read.schema(): явне визначення схем.na.drop(): видалення рядків із пропусками.select(), .filter(), .sort(), .orderBy(): базові функції обробки данихВступ до PySpark