Продвинутые операции с DataFrame

Введение в PySpark

Ben Schmidt

Data Engineer

Объединения в PySpark

  • Объединяет строки двух и более DataFrame по общим столбцам
  • Типы объединений: inner, left, right и outer — как в SQL

  • Синтаксис: DataFrame1.join(DataFrame2, on="column", how="join_type")

# Joining on id column using an inner join
df_joined = df1.join(df2, on="id", how="inner")

# Joining on columns with different names df_joined = df1.join(df2, df1.Id == df2.Name, "inner")
Введение в PySpark

Операция union

  • Объединяет строки двух DataFrame с одинаковой схемой

  • Синтаксис: DataFrame1.union(DataFrame2)

# Union of two DataFrames with identical schemas
df_union = df1.union(df2)
Введение в PySpark

Работа с массивами и словарями

Массивы: удобны для хранения списков в столбцах, синтаксис: ArrayType(StringType(),False)`

from pyspark.sql.functions import array, struct, lit

# Create an array column
df = df.withColumn("scores", array(lit(85), lit(90), lit(78)))

Словари (Maps): пары «ключ — значение» для данных словарного типа, MapType(StringType(),StringType())

from pyspark.sql.types import StructField, StructType, StringType, MapType

schema = StructType([
    StructField('name', StringType(), True),
    StructField('properties', MapType(StringType(), StringType()), True)
])
Введение в PySpark

Работа со структурами

  • Структуры: создают вложенные структуры внутри строк. Синтаксис: StructType(Structfield, Datatype())
# Create a struct column
df = df.withColumn("name_struct", struct("first_name", "last_name"))

# Create a struct column df = df.withColumn("name_struct", struct("first_name", "last_name"))
Введение в PySpark

Давайте потренируемся!

Введение в PySpark

Preparing Video For Download...