Základy velkých dat

Big Data Fundamentals with PySpark

Upendra Devisetty

Science Analyst, CyVerse

Co jsou velká data?

  • Velká data označují datové sady příliš složité pro tradiční software na zpracování dat – Wikipedia
Big Data Fundamentals with PySpark

3 V velkých dat

  • Objem, Rozmanitost a Rychlost

  • Objem: Velikost dat

  • Rozmanitost: Různé zdroje a formáty

  • Rychlost: Rychlost vzniku dat

Big Data Fundamentals with PySpark

Pojmy a terminologie velkých dat

  • Clusterové výpočty: Sdružení prostředků více strojů

  • Paralelní výpočty: Souběžné výpočty na jednom počítači

  • Distribuované výpočty: Síť uzlů (propojených počítačů) fungujících paralelně

  • Dávkové zpracování: Rozdělení úlohy na části spouštěné na jednotlivých strojích

  • Zpracování v reálném čase: Okamžité zpracování dat

Big Data Fundamentals with PySpark

Systémy pro zpracování velkých dat

  • Hadoop/MapReduce: Škálovatelný a odolný framework napsaný v Javě

    • Open source

    • Dávkové zpracování

  • Apache Spark: Univerzální a velmi rychlý systém pro clusterové výpočty

    • Open source

    • Dávkové i real-time zpracování dat

  • Poznámka: Apache Spark je v současnosti preferován před Hadoop/MapReduce

Big Data Fundamentals with PySpark

Vlastnosti frameworku Apache Spark

  • Distribuovaný framework pro clusterové výpočty

  • Efektivní výpočty v paměti pro velké datové sady

  • Velmi rychlý framework pro zpracování dat

  • Podpora jazyků Java, Scala, Python, R a SQL

Big Data Fundamentals with PySpark

Komponenty Apache Spark

spark

Big Data Fundamentals with PySpark

Režimy nasazení Sparku

  • Lokální režim: Jeden počítač, např. laptop

    • Vhodný pro testování, ladění a demonstrace
  • Clusterový režim: Sada předem definovaných strojů

    • Vhodný pro produkci
  • Postup: lokálně -> cluster

  • Není nutná změna kódu

Big Data Fundamentals with PySpark

Co nás čeká – PySpark

Big Data Fundamentals with PySpark

Preparing Video For Download...