Big Data Fundamentals with PySpark
Upendra Devisetty
Science Analyst, CyVerse
Kapitola 1: Základy BigData a úvod do Sparku jako frameworku pro distribuované výpočty
Hlavní komponenty: Spark Core a vestavěné knihovny – Spark SQL, Spark MLlib, GraphX a Spark Streaming
PySpark: Python API pro Apache Spark k spouštění Spark úloh
PySpark shell: Pro vývoj interaktivních aplikací v Pythonu
Režimy Sparku: lokální režim a režim clusteru
Kapitola 2: Úvod do RDD, jejich vlastnosti, způsoby vytváření a operace s RDD (transformace a akce)
Kapitola 3: Úvod do Spark SQL, abstrakce DataFrame, vytváření DataFramů, operace s DataFramy a vizualizace velkých dat
Kapitola 4: Úvod do Spark MLlib, tři oblasti strojového učení (kolaborativní filtrování, klasifikace a shlukování)
Big Data Fundamentals with PySpark