Python में Spark SQL परिचय
Mark Plutowski
Data Scientist
Spark Task एक execution unit है जो एक single CPU पर चलता है
Spark Stage ऐसे tasks का समूह है जो समान computation parallel में करते हैं, हर task आमतौर पर डेटा के अलग subset पर चलता है
Spark Job एक action से ट्रिगर हुई computation है, जिसे एक या अधिक stages में बाँटा जाता है।



spark.catalog.cacheTable('table1')spark.catalog.uncacheTable('table1')spark.catalog.isCached('table1')spark.catalog.dropTempView('table1')spark.catalog.listTables()
[Table(name='text', database=None, description=None, tableType='TEMPORARY', isTemporary=True)]


दिखाता है कि data partitions कहाँ हैं:
query3agg = """ SELECT w1, w2, w3, COUNT(*) as count FROM ( SELECT word AS w1, LEAD(word,1) OVER(PARTITION BY part ORDER BY id ) AS w2, LEAD(word,2) OVER(PARTITION BY part ORDER BY id ) AS w3 FROM df ) GROUP BY w1, w2, w3 ORDER BY count DESC """spark.sql(query3agg).show()




Python में Spark SQL परिचय