Introduction à Spark SQL en Python
Mark Plutowski
Data Scientist
Une tâche Spark est une unité d'exécution qui s'exécute sur un seul processeur
Étape Spark un groupe de tâches effectuant le même calcul en parallèle, chaque tâche traitant généralement un sous-ensemble différent des données
Travail Spark un calcul déclenché par une action, découpé en une ou plusieurs étapes.



spark.catalog.cacheTable('table1')spark.catalog.uncacheTable('table1')spark.catalog.isCached('table1')spark.catalog.dropTempView('table1')spark.catalog.listTables()
[Table(name='text', database=None, description=None, tableType='TEMPORARY', isTemporary=True)]


Indique où se trouvent les partitions de données
query3agg = """ SELECT w1, w2, w3, COUNT(*) as count FROM ( SELECT word AS w1, LEAD(word,1) OVER(PARTITION BY part ORDER BY id ) AS w2, LEAD(word,2) OVER(PARTITION BY part ORDER BY id ) AS w3 FROM df ) GROUP BY w1, w2, w3 ORDER BY count DESC """spark.sql(query3agg).show()




Introduction à Spark SQL en Python