Fundamentele Big Data cu PySpark
Upendra Devisetty
Science Analyst, CyVerse
Capitolul 1: Fundamentele Big Data și introducere în Spark ca framework de calcul distribuit
Componente principale: Spark Core și bibliotecile integrate - Spark SQL, Spark MLlib, GraphX și Spark Streaming
PySpark: API-ul Python al Apache Spark pentru executarea joburilor Spark
Shell PySpark: pentru dezvoltarea aplicațiilor interactive în Python
Moduri Spark: local și cluster
Capitolul 2: Introducere în RDD-uri, caracteristici ale RDD-urilor, metode de creare și operații RDD (Transformări și Acțiuni)
Capitolul 3: Introducere în Spark SQL, abstractizarea DataFrame, crearea DataFrame-urilor, operații și vizualizarea datelor mari prin DataFrame-uri
Capitolul 4: Introducere în Spark MLlib, cele trei C-uri ale învățării automate (Filtrare colaborativă, Clasificare și Clustering)
Fundamentele Big Data cu PySpark