Principes de Big Data avec PySpark
Upendra Devisetty
Science Analyst, CyVerse
La visualisation de données représente vos données sous forme de graphiques ou de diagrammes
Outils libres pour tracer en Python :
Tracer des graphiques avec des DataFrames PySpark se fait de trois façons
bibliothèque pyspark_dist_explore
toPandas()
bibliothèque HandySpark
La bibliothèque Pyspark_dist_explore offre des aperçus rapides des DataFrames
Trois fonctions disponibles : hist(), distplot() et pandas_histogram()
test_df = spark.read.csv("test.csv", header=True, inferSchema=True)
test_df_age = test_df.select('Age')
hist(test_df_age, bins=20, color="red")
test_df = spark.read.csv("test.csv", header=True, inferSchema=True)
test_df_sample_pandas = test_df.toPandas()
test_df_sample_pandas.hist('Age')
toPandas() n'est pas recommandéLes DataFrames pandas sont en mémoire sur un seul serveur, tandis que les opérations PySpark s'exécutent en parallèle
En pandas, le résultat est produit dès l'application d'une opération, alors que les opérations sur un DataFrame PySpark sont évaluées paresseusement
Les DataFrames pandas sont mutables et les DataFrames PySpark sont immuables
L'API pandas prend en charge plus d'opérations que l'API des DataFrames PySpark
test_df = spark.read.csv('test.csv', header=True, inferSchema=True)
hdf = test_df.toHandy()
hdf.cols["Age"].hist()
Principes de Big Data avec PySpark