Grunderna i Big Data

Grunderna i Big Data med PySpark

Upendra Devisetty

Science Analyst, CyVerse

Vad är Big Data?

  • Big data är ett begrepp för studier och tillämpningar av datamängder som är för komplexa för traditionell databehandlingsprogramvara - Wikipedia
Grunderna i Big Data med PySpark

Big Datas tre V:n

  • Volym, variation och hastighet

  • Volym: Datamängdens storlek

  • Variation: Olika källor och format

  • Hastighet: Hur snabbt data flödar

Grunderna i Big Data med PySpark

Begrepp och terminologi inom Big Data

  • Klusterdatorer: Samlade resurser från flera maskiner

  • Parallellberäkning: Samtidig beräkning på en enda dator

  • Distribuerad beräkning: Noder (nätverkskopplade datorer) som körs parallellt

  • Batchbehandling: Jobbet delas upp i mindre delar och körs på enskilda maskiner

  • Realtidsbehandling: Omedelbar bearbetning av data

Grunderna i Big Data med PySpark

System för Big Data-bearbetning

  • Hadoop/MapReduce: Skalbart och feltolerant ramverk skrivet i Java

    • Öppen källkod

    • Batchbehandling

  • Apache Spark: Allmänt klusterberäkningssystem med hög prestanda

    • Öppen källkod

    • Stöd för både batch- och realtidsbearbetning

  • Obs: Apache Spark föredras numera framför Hadoop/MapReduce

Grunderna i Big Data med PySpark

Funktioner i Apache Spark

  • Distribuerat ramverk för klusterberäkning

  • Effektiva minnesinterna beräkningar för stora datamängder

  • Snabb databehandling

  • Stöd för Java, Scala, Python, R och SQL

Grunderna i Big Data med PySpark

Apache Spark-komponenter

spark-komponenter

Grunderna i Big Data med PySpark

Spark-driftsättningslägen

  • Lokalt läge: En enda maskin, t.ex. din laptop

    • Passar bra för testning, felsökning och demonstration
  • Klusterläge: En uppsättning fördefinierade maskiner

    • Lämpligt för produktion
  • Arbetsflöde: Lokalt → kluster

  • Ingen kodändring krävs

Grunderna i Big Data med PySpark

Härnäst – PySpark

Grunderna i Big Data med PySpark

Preparing Video For Download...