Spark SQL 소개

PySpark 입문

Benjamin Schmidt

Data Engineer

Spark SQL이란

  • 구조적 데이터 처리를 위한 Apache Spark 모듈
  • 데이터 처리 작업과 함께 SQL 쿼리 실행 가능
  • 하나의 애플리케이션에서 Python과 SQL을 매끄럽게 결합
  • DataFrame 인터페이스: 구조적 데이터에 대한 프로그래밍 접근 제공
PySpark 입문

임시 테이블 생성

# Initialize Spark session
spark = SparkSession.builder.appName("Spark SQL Example").getOrCreate()

# Sample DataFrame data = [("Alice", "HR", 30), ("Bob", "IT", 40), ("Cathy", "HR", 28)] columns = ["Name", "Department", "Age"] df = spark.createDataFrame(data, schema=columns)
# Register DataFrame as a temporary view df.createOrReplaceTempView("people")
# Query using SQL result = spark.sql("SELECT Name, Age FROM people WHERE Age > 30") result.show()
PySpark 입문

임시 뷰 더 알아보기

  • 임시 뷰는 분석 중 기본 데이터를 보호합니다
  • CSV 로드는 이미 알고 있는 메서드를 사용합니다
    df = spark.read.csv("path/to/your/file.csv", header=True, inferSchema=True)
    
# Register DataFrame as a temporary view
df.createOrReplaceTempView("employees")
PySpark 입문

SQL과 DataFrame 연산 결합

# SQL query result
query_result = spark.sql("SELECT Name, Salary FROM employees WHERE Salary > 3000")

# DataFrame transformation high_earners = query_result.withColumn("Bonus", query_result.Salary * 0.1) high_earners.show()
PySpark 입문

연습해 봅시다!

PySpark 입문

Preparing Video For Download...