Grunderna i Big Data med PySpark
Upendra Devisetty
Science Analyst, CyVerse
Datavisualisering innebär att data representeras i grafer eller diagram
Verktyg för visualisering i Python med öppen källkod:
Tre metoder för att rita grafer med PySpark DataFrames
biblioteket pyspark_dist_explore
toPandas()
biblioteket HandySpark
Biblioteket Pyspark_dist_explore ger snabba insikter om DataFrames
Tre tillgängliga funktioner: hist(), distplot() och pandas_histogram()
test_df = spark.read.csv("test.csv", header=True, inferSchema=True)
test_df_age = test_df.select('Age')
hist(test_df_age, bins=20, color="red")
test_df = spark.read.csv("test.csv", header=True, inferSchema=True)
test_df_sample_pandas = test_df.toPandas()
test_df_sample_pandas.hist('Age')
toPandas()pandas DataFrames är minnesbaserade, serverlocala strukturer, medan PySpark körs parallellt
I pandas genereras resultatet direkt vid varje operation, medan PySpark DataFrames använder lazy evaluation
pandas DataFrames är muterbara och PySpark DataFrames är oföränderliga
pandas API stöder fler operationer än PySpark DataFrame API
test_df = spark.read.csv('test.csv', header=True, inferSchema=True)
hdf = test_df.toHandy()
hdf.cols["Age"].hist()
Grunderna i Big Data med PySpark