Notions de base sur le Big Data

Principes de Big Data avec PySpark

Upendra Devisetty

Science Analyst, CyVerse

Qu'est-ce que le Big Data ?

  • Le Big Data désigne l'étude et l'utilisation d'ensembles de données trop complexes pour les logiciels classiques de traitement des données - Wikipédia
Principes de Big Data avec PySpark

Les 3 V du Big Data

  • Volume, Variété et Vélocité

  • Volume : taille des données

  • Variété : sources et formats variés

  • Vélocité : vitesse des données

Principes de Big Data avec PySpark

Concepts et terminologie du Big Data

  • Infonuagique en grappe (cluster computing) : mise en commun des ressources de plusieurs machines

  • Calcul parallèle : calculs simultanés sur un seul ordinateur

  • Calcul distribué : ensemble de nœuds (ordinateurs en réseau) exécutés en parallèle

  • Traitement par lots : découper la tâche en petites unités et les exécuter sur des machines distinctes

  • Traitement en temps réel : traitement immédiat des données

Principes de Big Data avec PySpark

Systèmes de traitement Big Data

  • Hadoop/MapReduce : cadre évolutif et tolérant aux pannes, écrit en Java

    • Code source ouvert

    • Traitement par lots

  • Apache Spark : système de calcul en grappe polyvalent et ultra-rapide

    • Code source ouvert

    • Traitement des données par lots et en temps réel

  • Remarque : Apache Spark est aujourd'hui privilégié par rapport à Hadoop/MapReduce

Principes de Big Data avec PySpark

Fonctionnalités du cadre Apache Spark

  • Cadre de calcul distribué en grappe

  • Calculs en mémoire efficaces pour de grands ensembles de données

  • Cadre de traitement des données ultra-rapide

  • Prend en charge Java, Scala, Python, R et SQL

Principes de Big Data avec PySpark

Composants d'Apache Spark

spark

Principes de Big Data avec PySpark

Modes de déploiement de Spark

  • Mode local : une seule machine, comme votre portable

    • Pratique pour les tests, le débogage et les démonstrations
  • Mode grappe : ensemble de machines prédéfinies

    • Adapté à la production
  • Flux de travail : local -> grappes

  • Aucun changement de code nécessaire

Principes de Big Data avec PySpark

À venir : PySpark

Principes de Big Data avec PySpark

Preparing Video For Download...