Principes de Big Data avec PySpark
Upendra Devisetty
Science Analyst, CyVerse
Volume, Variété et Vélocité
Volume : taille des données
Variété : sources et formats variés
Vélocité : vitesse des données
Infonuagique en grappe (cluster computing) : mise en commun des ressources de plusieurs machines
Calcul parallèle : calculs simultanés sur un seul ordinateur
Calcul distribué : ensemble de nœuds (ordinateurs en réseau) exécutés en parallèle
Traitement par lots : découper la tâche en petites unités et les exécuter sur des machines distinctes
Traitement en temps réel : traitement immédiat des données
Hadoop/MapReduce : cadre évolutif et tolérant aux pannes, écrit en Java
Code source ouvert
Traitement par lots
Apache Spark : système de calcul en grappe polyvalent et ultra-rapide
Code source ouvert
Traitement des données par lots et en temps réel
Remarque : Apache Spark est aujourd'hui privilégié par rapport à Hadoop/MapReduce
Cadre de calcul distribué en grappe
Calculs en mémoire efficaces pour de grands ensembles de données
Cadre de traitement des données ultra-rapide
Prend en charge Java, Scala, Python, R et SQL

Mode local : une seule machine, comme votre portable
Mode grappe : ensemble de machines prédéfinies
Flux de travail : local -> grappes
Aucun changement de code nécessaire
Principes de Big Data avec PySpark