Grunderna i Big Data med PySpark
Upendra Devisetty
Science Analyst, CyVerse
Kapitel 1: Grunderna i BigData och introduktion till Spark som ramverk för distribuerad beräkning
Huvudkomponenter: Spark Core och Sparks inbyggda bibliotek – Spark SQL, Spark MLlib, Graphx och Spark Streaming
PySpark: Apache Sparks Python-API för att köra Spark-jobb
PySpark-skal: För att utveckla interaktiva applikationer i Python
Spark-lägen: Lokalt läge och klusterläge
Kapitel 2: Introduktion till RDD:er, deras egenskaper, sätt att skapa RDD:er samt RDD-operationer (transformationer och åtgärder)
Kapitel 3: Introduktion till Spark SQL, DataFrame-abstraktion, skapande av DataFrames, DataFrame-operationer och visualisering av stordata via DataFrames
Kapitel 4: Introduktion till Spark MLlib och maskininlärningens tre C:n (kollaborativ filtrering, klassificering och klustring)
Grunderna i Big Data med PySpark