Wprowadzenie do Spark SQL w Pythonie
Mark Plutowski
Data Scientist
Zadanie Spark to jednostka wykonania działająca na jednym procesorze
Etap Spark to grupa zadań wykonujących te same obliczenia równolegle, zazwyczaj na różnych podzbiorach danych
Job Spark to obliczenie wyzwolone przez akcję, podzielone na jeden lub więcej etapów.



spark.catalog.cacheTable('table1')spark.catalog.uncacheTable('table1')spark.catalog.isCached('table1')spark.catalog.dropTempView('table1')spark.catalog.listTables()
[Table(name='text', database=None, description=None, tableType='TEMPORARY', isTemporary=True)]


Pokazuje, gdzie istnieją partycje danych
query3agg = """ SELECT w1, w2, w3, COUNT(*) as count FROM ( SELECT word AS w1, LEAD(word,1) OVER(PARTITION BY part ORDER BY id ) AS w2, LEAD(word,2) OVER(PARTITION BY part ORDER BY id ) AS w3 FROM df ) GROUP BY w1, w2, w3 ORDER BY count DESC """spark.sql(query3agg).show()




Wprowadzenie do Spark SQL w Pythonie