Big Data Fundamentals with PySpark
Upendra Devisetty
Science Analyst, CyVerse
Objem, Rozmanitost a Rychlost
Objem: Velikost dat
Rozmanitost: Různé zdroje a formáty
Rychlost: Rychlost vzniku dat
Clusterové výpočty: Sdružení prostředků více strojů
Paralelní výpočty: Souběžné výpočty na jednom počítači
Distribuované výpočty: Síť uzlů (propojených počítačů) fungujících paralelně
Dávkové zpracování: Rozdělení úlohy na části spouštěné na jednotlivých strojích
Zpracování v reálném čase: Okamžité zpracování dat
Hadoop/MapReduce: Škálovatelný a odolný framework napsaný v Javě
Open source
Dávkové zpracování
Apache Spark: Univerzální a velmi rychlý systém pro clusterové výpočty
Open source
Dávkové i real-time zpracování dat
Poznámka: Apache Spark je v současnosti preferován před Hadoop/MapReduce
Distribuovaný framework pro clusterové výpočty
Efektivní výpočty v paměti pro velké datové sady
Velmi rychlý framework pro zpracování dat
Podpora jazyků Java, Scala, Python, R a SQL

Lokální režim: Jeden počítač, např. laptop
Clusterový režim: Sada předem definovaných strojů
Postup: lokálně -> cluster
Není nutná změna kódu
Big Data Fundamentals with PySpark