스파크 SQL

Python에서 Spark SQL 입문

Mark Plutowski Phd

Data Scientist

SQL 테이블 생성 및 쿼리

Pyspark 셸 커서

Python에서 Spark SQL 입문

파일에서 데이터프레임 로드

df = spark.read.csv(filename)
df = spark.read.csv(filename, header=True)
Python에서 Spark SQL 입문

SQL 테이블 생성 및 쿼리

df.createOrReplaceTempView("schedule")

spark.sql("SELECT * FROM schedule WHERE station = 'San Jose'") .show()
+--------+--------+-----+
|train_id| station| time|
+--------+--------+-----+
|     324|San Jose|9:05a|
|     217|San Jose|6:59a|
+--------+--------+-----+
Python에서 Spark SQL 입문

테이블 스키마 검사

result = spark.sql("SHOW COLUMNS FROM tablename")
result = spark.sql("SELECT * FROM tablename LIMIT 0")
result = spark.sql("DESCRIBE tablename")
result.show()
print(result.columns)
Python에서 Spark SQL 입문

프레임

Python에서 Spark SQL 입문

데이터 프레임

Python에서 Spark SQL 입문

표 형식 데이터

+--------+-------------+-----+
|train_id|      station| time|
+--------+-------------+-----+
|     324|San Francisco|7:59a| 
|     324|  22nd Street|8:03a|
|     324|     Millbrae|8:16a|
|     324|    Hillsdale|8:24a|
|     324| Redwood City|8:31a|
|     324|    Palo Alto|8:37a|
|     324|     San Jose|9:05a|
|     217|       Gilroy|6:06a|
|     217|   San Martin|6:15a|
|     217|  Morgan Hill|6:21a|
|     217| Blossom Hill|6:36a|
|     217|      Capitol|6:42a|
|     217|       Tamien|6:50a|
|     217|     San Jose|6:59a|
+--------+-------------+-----+
Python에서 Spark SQL 입문

두 데이터프레임

Python에서 Spark SQL 입문

두 데이터프레임 연결

Python에서 Spark SQL 입문

하나의 데이터프레임

Python에서 Spark SQL 입문

데이터프레임 분할 1

Python에서 Spark SQL 입문

데이터프레임 분할 2

Python에서 Spark SQL 입문

데이터프레임 분할 3

Python에서 Spark SQL 입문

데이터프레임 분할 4

Python에서 Spark SQL 입문

데이터프레임 분할 5

Python에서 Spark SQL 입문

데이터프레임 분할 6

Python에서 Spark SQL 입문

분산된 데이터프레임

Python에서 Spark SQL 입문

SQL

Python에서 Spark SQL 입문

구조화 질의어

Python에서 Spark SQL 입문

쿼리

Python에서 Spark SQL 입문

분산 데이터

Python에서 Spark SQL 입문

분산 데이터 + 쿼리

Python에서 Spark SQL 입문

구분 텍스트 로드

쉼표로 구분된 파일 trainsched.txtdf 데이터프레임으로 로드합니다:

df = spark.read.csv("trainsched.txt", header=True)
Python에서 Spark SQL 입문

구분 텍스트 로드

df = spark.read.csv("trainsched.txt", header=True)
df.show()
+--------+-------------+-----+
|train_id|      station| time|
+--------+-------------+-----+
|     324|San Francisco|7:59a|
|     324|  22nd Street|8:03a|
|     324|     Millbrae|8:16a|
|     324|    Hillsdale|8:24a|
|     324| Redwood City|8:31a|
|     ...|          ...|  ...|
|     217| Blossom Hill|6:36a|
|     217|      Capitol|6:42a|
|     217|       Tamien|6:50a|
|     217|     San Jose|6:59a|
+--------+-------------+-----+
Python에서 Spark SQL 입문

Pyspark 셸

Python에서 Spark SQL 입문

Pyspark 셸 커서

Python에서 Spark SQL 입문

Pyspark 셸

Python에서 Spark SQL 입문

Pyspark 셸 커서

Python에서 Spark SQL 입문

Pyspark 셸

Python에서 Spark SQL 입문

Python에서 Spark SQL 입문

Pyspark 셸

Python에서 Spark SQL 입문

Pyspark 셸 커서

Python에서 Spark SQL 입문

Pyspark 셸

Python에서 Spark SQL 입문

Pyspark 셸 커서

Python에서 Spark SQL 입문

Pyspark 셸

Python에서 Spark SQL 입문

Pyspark 셸 커서

Python에서 Spark SQL 입문

아직 연습해 봅시다

Python에서 Spark SQL 입문

Preparing Video For Download...