Datavisualisering i PySpark med DataFrames

Grunderna i Big Data med PySpark

Upendra Devisetty

Science Analyst, CyVerse

Vad är datavisualisering?

  • Datavisualisering innebär att data representeras i grafer eller diagram

  • Verktyg för visualisering i Python med öppen källkod:

    • Matplotlib, Seaborn, Bokeh m.fl.
  • Tre metoder för att rita grafer med PySpark DataFrames

    • biblioteket pyspark_dist_explore

    • toPandas()

    • biblioteket HandySpark

Grunderna i Big Data med PySpark

Datavisualisering med Pyspark_dist_explore

  • Biblioteket Pyspark_dist_explore ger snabba insikter om DataFrames

  • Tre tillgängliga funktioner: hist(), distplot() och pandas_histogram()

test_df = spark.read.csv("test.csv", header=True, inferSchema=True)
test_df_age = test_df.select('Age')
hist(test_df_age, bins=20, color="red")
Grunderna i Big Data med PySpark

Använda pandas för att rita DataFrames

  • Det är enkelt att skapa diagram från pandas DataFrames
test_df = spark.read.csv("test.csv", header=True, inferSchema=True)
test_df_sample_pandas = test_df.toPandas()
test_df_sample_pandas.hist('Age')
  • Obs! Vid stora datamängder rekommenderas inte toPandas()
Grunderna i Big Data med PySpark

pandas DataFrame vs PySpark DataFrame

  • pandas DataFrames är minnesbaserade, serverlocala strukturer, medan PySpark körs parallellt

  • I pandas genereras resultatet direkt vid varje operation, medan PySpark DataFrames använder lazy evaluation

  • pandas DataFrames är muterbara och PySpark DataFrames är oföränderliga

  • pandas API stöder fler operationer än PySpark DataFrame API

Grunderna i Big Data med PySpark

Visualisering med HandySpark

  • HandySpark är ett paket utformat för att förbättra upplevelsen av PySpark
    • Enkel datahämtning
    • Distribuerad beräkning bibehålls
test_df = spark.read.csv('test.csv', header=True, inferSchema=True)
hdf = test_df.toHandy()
hdf.cols["Age"].hist()
Grunderna i Big Data med PySpark

Nu kör vi en övning!

Grunderna i Big Data med PySpark

Preparing Video For Download...