Python에서 Spark SQL 입문
Mark Plutowski
Data Scientist
Spark Task: 단일 CPU에서 실행되는 작업 단위
Spark Stage: 동일 연산을 병렬 수행하는 태스크 묶음. 각 태스크는 데이터의 서로 다른 부분집합에서 실행됨
Spark Job: 액션으로 트리거되는 연산. 하나 이상의 스테이지로 분할됨



spark.catalog.cacheTable('table1')spark.catalog.uncacheTable('table1')spark.catalog.isCached('table1')spark.catalog.dropTempView('table1')spark.catalog.listTables()
[Table(name='text', database=None, description=None, tableType='TEMPORARY', isTemporary=True)]


데이터 파티션 위치 표시:
query3agg = """ SELECT w1, w2, w3, COUNT(*) as count FROM ( SELECT word AS w1, LEAD(word,1) OVER(PARTITION BY part ORDER BY id ) AS w2, LEAD(word,2) OVER(PARTITION BY part ORDER BY id ) AS w3 FROM df ) GROUP BY w1, w2, w3 ORDER BY count DESC """spark.sql(query3agg).show()




Python에서 Spark SQL 입문