Spark SQL 入門

PySpark 入門

Benjamin Schmidt

Data Engineer

什麼是 Spark SQL

  • Apache Spark 中用於結構化資料處理的模組
  • 讓你在資料處理任務旁同時執行 SQL 查詢
  • 在同一個應用中無縫結合 Python 與 SQL
  • DataFrame 介面:提供對結構化資料的程式化存取
PySpark 入門

建立暫存資料表

# Initialize Spark session
spark = SparkSession.builder.appName("Spark SQL Example").getOrCreate()

# Sample DataFrame data = [("Alice", "HR", 30), ("Bob", "IT", 40), ("Cathy", "HR", 28)] columns = ["Name", "Department", "Age"] df = spark.createDataFrame(data, schema=columns)
# Register DataFrame as a temporary view df.createOrReplaceTempView("people")
# Query using SQL result = spark.sql("SELECT Name, Age FROM people WHERE Age > 30") result.show()
PySpark 入門

更深入的暫存檢視

  • 暫存檢視可在分析時保護底層資料
  • 從 CSV 載入用你已熟悉的方法
    df = spark.read.csv("path/to/your/file.csv", header=True, inferSchema=True)
    
# Register DataFrame as a temporary view
df.createOrReplaceTempView("employees")
PySpark 入門

結合 SQL 與 DataFrame 操作

# SQL query result
query_result = spark.sql("SELECT Name, Salary FROM employees WHERE Salary > 3000")

# DataFrame transformation high_earners = query_result.withColumn("Bonus", query_result.Salary * 0.1) high_earners.show()
PySpark 入門

一起來練習吧!

PySpark 入門

Preparing Video For Download...