Principes de Big Data avec PySpark
Upendra Devisetty
Science Analyst, CyVerse
Chapitre 1 : Principes de Big Data et introduction à Spark comme cadre de calcul distribué
Composants principaux : Spark Core et bibliothèques intégrées — Spark SQL, Spark MLlib, GraphX et Spark Streaming
PySpark : API Python d'Apache Spark pour exécuter des travaux Spark
Interpréteur PySpark : pour créer des applications interactives en Python
Modes Spark : mode local et mode grappe
Chapitre 2 : Introduction aux RDD, leurs caractéristiques, méthodes de création et opérations sur les RDD (Transformations et Actions)
Chapitre 3 : Introduction à Spark SQL, abstraction DataFrame, création de DataFrames, opérations sur les DataFrames et visualisation des mégadonnées avec des DataFrames
Chapitre 4 : Introduction à Spark MLlib, les trois C du Machine Learning (filtrage collaboratif, classification et regroupement)
Principes de Big Data avec PySpark