Podstawy Big Data z PySpark
Upendra Devisetty
Science Analyst, CyVerse
Wolumen, Różnorodność i Prędkość
Wolumen: Rozmiar danych
Różnorodność: Różne źródła i formaty
Prędkość: Szybkość napływu danych
Obliczenia klastrowe: Zasoby wielu maszyn połączonych w klaster
Obliczenia równoległe: Jednoczesne obliczenia na jednym komputerze
Obliczenia rozproszone: Węzły (komputery w sieci) działające równolegle
Przetwarzanie wsadowe: Podział zadania na części i wykonanie na osobnych maszynach
Przetwarzanie w czasie rzeczywistym: Natychmiastowe przetwarzanie danych
Hadoop/MapReduce: Skalowalna i odporna na błędy platforma napisana w Javie
Open source
Przetwarzanie wsadowe
Apache Spark: Szybki system obliczeniowy ogólnego przeznaczenia
Open source
Przetwarzanie wsadowe i w czasie rzeczywistym
Uwaga: Apache Spark jest obecnie preferowany nad Hadoop/MapReduce
Rozproszony framework do obliczeń klastrowych
Wydajne obliczenia w pamięci dla dużych zbiorów danych
Bardzo szybki framework do przetwarzania danych
Obsługa języków Java, Scala, Python, R i SQL

Tryb lokalny: Pojedyncza maszyna, np. laptop
Tryb klastrowy: Zestaw zdefiniowanych maszyn
Przepływ pracy: lokalnie -> klastry
Nie wymaga zmian w kodzie
Podstawy Big Data z PySpark