Fundamentele Big Data cu PySpark
Upendra Devisetty
Science Analyst, CyVerse
Volum, Varietate și Viteză
Volum: Dimensiunea datelor
Varietate: Surse și formate diferite
Viteză: Rapiditatea datelor
Calcul în cluster: Agregarea resurselor mai multor mașini
Calcul paralel: Procesare simultană pe un singur computer
Calcul distribuit: Noduri interconectate care rulează în paralel
Procesare batch: Împărțirea sarcinii în segmente mici executate individual
Procesare în timp real: Procesarea imediată a datelor
Hadoop/MapReduce: Framework scalabil și tolerant la erori, scris în Java
Open source
Procesare batch
Apache Spark: Sistem de calcul în cluster rapid și de uz general
Open source
Procesare batch și în timp real
Notă: Apache Spark este în prezent preferat față de Hadoop/MapReduce
Framework de calcul distribuit în cluster
Calcule eficiente în memorie pentru seturi mari de date
Framework de procesare a datelor extrem de rapid
Suport pentru Java, Scala, Python, R și SQL

Modul local: O singură mașină, de ex. laptopul dvs.
Modul cluster: Set de mașini predefinite
Flux de lucru: Local -> cluster
Nu sunt necesare modificări de cod
Fundamentele Big Data cu PySpark