Grunderna i Big Data med PySpark
Upendra Devisetty
Science Analyst, CyVerse
Volym, variation och hastighet
Volym: Datamängdens storlek
Variation: Olika källor och format
Hastighet: Hur snabbt data flödar
Klusterdatorer: Samlade resurser från flera maskiner
Parallellberäkning: Samtidig beräkning på en enda dator
Distribuerad beräkning: Noder (nätverkskopplade datorer) som körs parallellt
Batchbehandling: Jobbet delas upp i mindre delar och körs på enskilda maskiner
Realtidsbehandling: Omedelbar bearbetning av data
Hadoop/MapReduce: Skalbart och feltolerant ramverk skrivet i Java
Öppen källkod
Batchbehandling
Apache Spark: Allmänt klusterberäkningssystem med hög prestanda
Öppen källkod
Stöd för både batch- och realtidsbearbetning
Obs: Apache Spark föredras numera framför Hadoop/MapReduce
Distribuerat ramverk för klusterberäkning
Effektiva minnesinterna beräkningar för stora datamängder
Snabb databehandling
Stöd för Java, Scala, Python, R och SQL

Lokalt läge: En enda maskin, t.ex. din laptop
Klusterläge: En uppsättning fördefinierade maskiner
Arbetsflöde: Lokalt → kluster
Ingen kodändring krävs
Grunderna i Big Data med PySpark