Podstawy Big Data z PySpark
Upendra Devisetty
Science Analyst, CyVerse
Rozdział 1: Podstawy BigData i wprowadzenie do Spark jako frameworku przetwarzania rozproszonego
Główne komponenty: Spark Core i wbudowane biblioteki - Spark SQL, Spark MLlib, GraphX i Spark Streaming
PySpark: Python API Apache Spark do uruchamiania zadań Spark
PySpark shell: Do tworzenia interaktywnych aplikacji w Pythonie
Tryby Spark: lokalny i klastrowy
Rozdział 2: Wprowadzenie do RDD, cechy RDD, metody tworzenia RDD oraz operacje RDD (transformacje i akcje)
Rozdział 3: Wprowadzenie do Spark SQL, abstrakcja DataFrame, tworzenie DataFrame, operacje na DataFrame i wizualizacja Big Data
Rozdział 4: Wprowadzenie do Spark MLlib i trzech obszarów uczenia maszynowego (filtrowanie kolaboratywne, klasyfikacja i klasteryzacja)
Podstawy Big Data z PySpark