Introduction to Spark SQL in Python
Mark Plutowski
Data Scientist
Spark Task คือหน่วยการประมวลผลที่รันบน CPU เดียว
Spark Stage คือกลุ่มของ Task ที่ทำการคำนวณเดียวกันแบบขนาน โดยแต่ละ Task มักรันบนชุดข้อมูลย่อยที่ต่างกัน
Spark Job คือการคำนวณที่ถูกเรียกใช้โดย Action และแบ่งออกเป็นหนึ่ง Stage หรือมากกว่า



spark.catalog.cacheTable('table1')spark.catalog.uncacheTable('table1')spark.catalog.isCached('table1')spark.catalog.dropTempView('table1')spark.catalog.listTables()
[Table(name='text', database=None, description=None, tableType='TEMPORARY', isTemporary=True)]


แสดงตำแหน่งของ Data Partition
query3agg = """ SELECT w1, w2, w3, COUNT(*) as count FROM ( SELECT word AS w1, LEAD(word,1) OVER(PARTITION BY part ORDER BY id ) AS w2, LEAD(word,2) OVER(PARTITION BY part ORDER BY id ) AS w3 FROM df ) GROUP BY w1, w2, w3 ORDER BY count DESC """spark.sql(query3agg).show()




Introduction to Spark SQL in Python