Visualisation de données avec PySpark et DataFrames

Principes de Big Data avec PySpark

Upendra Devisetty

Science Analyst, CyVerse

Qu'est-ce que la visualisation de données ?

  • La visualisation de données représente vos données sous forme de graphiques ou de diagrammes

  • Outils libres pour tracer en Python :

    • Matplotlib, Seaborn, Bokeh, etc.
  • Tracer des graphiques avec des DataFrames PySpark se fait de trois façons

    • bibliothèque pyspark_dist_explore

    • toPandas()

    • bibliothèque HandySpark

Principes de Big Data avec PySpark

Visualisation avec Pyspark_dist_explore

  • La bibliothèque Pyspark_dist_explore offre des aperçus rapides des DataFrames

  • Trois fonctions disponibles : hist(), distplot() et pandas_histogram()

test_df = spark.read.csv("test.csv", header=True, inferSchema=True)
test_df_age = test_df.select('Age')
hist(test_df_age, bins=20, color="red")
Principes de Big Data avec PySpark

Utiliser pandas pour tracer des DataFrames

  • Il est simple de créer des graphiques à partir de DataFrames pandas
test_df = spark.read.csv("test.csv", header=True, inferSchema=True)
test_df_sample_pandas = test_df.toPandas()
test_df_sample_pandas.hist('Age')
  • Remarque : avec de gros volumes de données, toPandas() n'est pas recommandé
Principes de Big Data avec PySpark

DataFrame pandas vs DataFrame PySpark

  • Les DataFrames pandas sont en mémoire sur un seul serveur, tandis que les opérations PySpark s'exécutent en parallèle

  • En pandas, le résultat est produit dès l'application d'une opération, alors que les opérations sur un DataFrame PySpark sont évaluées paresseusement

  • Les DataFrames pandas sont mutables et les DataFrames PySpark sont immuables

  • L'API pandas prend en charge plus d'opérations que l'API des DataFrames PySpark

Principes de Big Data avec PySpark

Méthode de visualisation avec HandySpark

  • HandySpark est un paquet conçu pour améliorer l'expérience utilisateur de PySpark
    • Extraction de données facilitée
    • Calcul distribué conservé
test_df = spark.read.csv('test.csv', header=True, inferSchema=True)
hdf = test_df.toHandy()
hdf.cols["Age"].hist()
Principes de Big Data avec PySpark

Visualisons des DataFrames

Principes de Big Data avec PySpark

Preparing Video For Download...