Úvod do Spark SQL v Pythonu
Mark Plutowski
Data Scientist
Spark Task je jednotka výpočtu spuštěná na jednom CPU
Spark Stage je skupina tasků provádějících stejný výpočet paralelně, přičemž každý task zpracovává zpravidla jinou část dat
Spark Job je výpočet spuštěný akcí, rozdělený do jedné nebo více stages



spark.catalog.cacheTable('table1')spark.catalog.uncacheTable('table1')spark.catalog.isCached('table1')spark.catalog.dropTempView('table1')spark.catalog.listTables()
[Table(name='text', database=None, description=None, tableType='TEMPORARY', isTemporary=True)]


Zobrazuje umístění datových oddílů
query3agg = """ SELECT w1, w2, w3, COUNT(*) as count FROM ( SELECT word AS w1, LEAD(word,1) OVER(PARTITION BY part ORDER BY id ) AS w2, LEAD(word,2) OVER(PARTITION BY part ORDER BY id ) AS w3 FROM df ) GROUP BY w1, w2, w3 ORDER BY count DESC """spark.sql(query3agg).show()




Úvod do Spark SQL v Pythonu