Big Data Fundamentals with PySpark
Upendra Devisetty
Science Analyst, CyVerse
Vizualizace dat představuje zobrazení dat pomocí grafů nebo diagramů
Nástroje pro vizualizaci v Pythonu s otevřeným zdrojovým kódem:
Grafy z PySpark DataFrames lze vytvářet třemi způsoby
knihovna pyspark_dist_explore
toPandas()
knihovna HandySpark
Knihovna Pyspark_dist_explore poskytuje rychlý přehled o DataFrames
Aktuálně jsou k dispozici tři funkce: hist(), distplot() a pandas_histogram()
test_df = spark.read.csv("test.csv", header=True, inferSchema=True)
test_df_age = test_df.select('Age')
hist(test_df_age, bins=20, color="red")
test_df = spark.read.csv("test.csv", header=True, inferSchema=True)
test_df_sample_pandas = test_df.toPandas()
test_df_sample_pandas.hist('Age')
toPandas() nedoporučujePandas DataFrames jsou struktury uložené v paměti jednoho serveru, zatímco operace v PySparku běží paralelně
V Pandas jsou výsledky dostupné okamžitě, zatímco PySpark DataFrame používá líné vyhodnocování
Pandas DataFrames jsou měnitelné, PySpark DataFrames jsou neměnitelné
Pandas API podporuje více operací než API PySpark DataFrame
test_df = spark.read.csv('test.csv', header=True, inferSchema=True)
hdf = test_df.toHandy()
hdf.cols["Age"].hist()
Big Data Fundamentals with PySpark