PySpark와 SQL로 데이터 다루기

Databricks에서 Spark SQL로 데이터 변환하기

Disha Mukherjee

Lead Data Engineer

데이터 형태 다듬기

path = "/Volumes/.../default/transactions.csv"
df = spark.read.csv(path, header=True, inferSchema=True)
df.show(5, truncate=False)

Databricks에서 결과 미리 보기

  • select() → 열 선택
  • filter() → 행 선택
Databricks에서 Spark SQL로 데이터 변환하기

열 선택하기

df.select("ID", "Customer_ID", "Transaction_Amount", "Category").show(5)
+---+-----------+------------------+-----------+
| ID|Customer_ID|Transaction_Amount|   Category|
+---+-----------+------------------+-----------+
|  1|    CUST001|          27337.49|Electronics|
|  2|    CUST002|           97716.6|Electronics|
|  3|    CUST003|           5752.36|Electronics|
|  4|    CUST004|          93443.22|    Savings|
|  5|    CUST005|          15109.98|Electronics|
+---+-----------+------------------+-----------+
Databricks에서 Spark SQL로 데이터 변환하기

행 필터링하기

from pyspark.sql import functions as F


filtered_df = df.filter(F.col("Transaction_Status") == "Completed") filtered_df.show(5)
+---+-------------------+-----------+------------------+------------------+
| ID|               Date|Customer_ID|Transaction_Amount|Transaction_Status|
+---+-------------------+-----------+------------------+------------------+
|  3|2023-01-03 00:00:00|    CUST003|           5752.36|         Completed|
|  9|2023-01-09 00:00:00|    CUST009|          28959.12|         Completed|
| 10|2023-01-10 00:00:00|    CUST010|          72098.18|         Completed|
| 11|2023-01-11 00:00:00|    CUST011|          49771.05|         Completed|
| 20|2023-01-20 00:00:00|    CUST020|          69825.14|         Completed|
+---+-------------------+-----------+------------------+------------------+
Databricks에서 Spark SQL로 데이터 변환하기

필터 조건 결합하기

high_value_df = df.filter(

(F.col("Transaction_Amount") > 20000) &
(F.col("Transaction_Status") == "Completed")
) high_value_df.show(3)
+---+-------------------+-----------+------------------+------------------+
| ID|               Date|Customer_ID|Transaction_Amount|Transaction_Status|
+---+-------------------+-----------+------------------+------------------+
|  9|2023-01-09 00:00:00|    CUST009|          28959.12|         Completed|
| 10|2023-01-10 00:00:00|    CUST010|          72098.18|         Completed|
| 11|2023-01-11 00:00:00|    CUST011|          49771.05|         Completed|
+---+-------------------+-----------+------------------+------------------+
Databricks에서 Spark SQL로 데이터 변환하기

Python 메서드 또는 SQL

 

  • Python 메서드: select(), filter()
    • 변환을 단계적으로 구성

 

$$

$$

  • SQL 쿼리: 표준 SQL 문법
    • 집계 및 그룹화에 더 가독성이 높음

Python과 SQL 비교

Databricks에서 Spark SQL로 데이터 변환하기

임시 뷰 만들기

$$

df.createOrReplaceTempView("transactions")

 

  • 임시 뷰 = DataFrame을 가리키는 이름
  • 현재 Spark 세션에서만 유지됨
Databricks에서 Spark SQL로 데이터 변환하기

SQL로 쿼리하기

%sql
SELECT Category, COUNT(*) AS transaction_count

FROM transactions
WHERE Transaction_Status = 'Completed' GROUP BY Category ORDER BY transaction_count DESC
+-----------+-----------------+
|   Category|transaction_count|
+-----------+-----------------+
|   Clothing|             6764|
|     Dining|             6732|
|Electronics|             6640|
|    Savings|             6629|
|  Groceries|             6557|
+-----------+-----------------+
Databricks에서 Spark SQL로 데이터 변환하기

display()로 검증하기

display(filtered_df)

정렬 및 검색 기능이 있는 대화형 테이블 GIF

$$

$$

$$

  • 결과 정렬 및 페이지 탐색
  • 결측값과 이상값 확인
Databricks에서 Spark SQL로 데이터 변환하기

쿼리 실행 계획 확인하기

filtered_df.explain()
== Physical Plan ==
*(1) Filter (Transaction_Status = Completed)
+- FileScan csv [ID, Date, Customer_ID, ...]

$$

$$

  • SQL에서도 사용 가능: EXPLAIN SELECT ...
  • 성능 문제 해결에 유용
Databricks에서 Spark SQL로 데이터 변환하기

Spark 오류 읽기

df.select("Account").show()
[UNRESOLVED_COLUMN.WITH_SUGGESTION] A column with name `Account` 
cannot be resolved. Did you mean one of the following? 
[`Date`, `Location`, `Customer_ID`, `Transaction_Amount`]
Databricks에서 Spark SQL로 데이터 변환하기

연습해 봅시다!

Databricks에서 Spark SQL로 데이터 변환하기

Preparing Video For Download...