แนะนำ Spark SQL

PySpark เบื้องต้น

Benjamin Schmidt

Data Engineer

Spark SQL คืออะไร

  • โมดูลใน Apache Spark สำหรับประมวลผลข้อมูลเชิงโครงสร้าง
  • รัน SQL query ควบคู่กับงานประมวลผลข้อมูลได้
  • ผสาน Python และ SQL ไว้ในแอปพลิเคชันเดียว
  • DataFrame Interfacing: เข้าถึงข้อมูลเชิงโครงสร้างแบบโปรแกรมได้
PySpark เบื้องต้น

การสร้าง temp table

# Initialize Spark session
spark = SparkSession.builder.appName("Spark SQL Example").getOrCreate()

# Sample DataFrame data = [("Alice", "HR", 30), ("Bob", "IT", 40), ("Cathy", "HR", 28)] columns = ["Name", "Department", "Age"] df = spark.createDataFrame(data, schema=columns)
# Register DataFrame as a temporary view df.createOrReplaceTempView("people")
# Query using SQL result = spark.sql("SELECT Name, Age FROM people WHERE Age > 30") result.show()
PySpark เบื้องต้น

เจาะลึก temp view

  • Temp View ช่วยปกป้องข้อมูลต้นฉบับระหว่างทำการวิเคราะห์
  • โหลดจาก CSV ด้วยเมธอดที่คุ้นเคยอยู่แล้ว
    df = spark.read.csv("path/to/your/file.csv", header=True, inferSchema=True)
    
# Register DataFrame as a temporary view
df.createOrReplaceTempView("employees")
PySpark เบื้องต้น

ผสาน SQL กับการดำเนินการ DataFrame

# SQL query result
query_result = spark.sql("SELECT Name, Salary FROM employees WHERE Salary > 3000")

# DataFrame transformation high_earners = query_result.withColumn("Bonus", query_result.Salary * 0.1) high_earners.show()
PySpark เบื้องต้น

มาฝึกกันเถอะ!

PySpark เบื้องต้น

Preparing Video For Download...