Основы Big Data с PySpark
Upendra Devisetty
Science Analyst, CyVerse
Визуализация данных — представление данных в виде графиков или диаграмм
Инструменты визуализации с открытым исходным кодом для Python:
Построение графиков на основе PySpark DataFrames выполняется тремя способами
библиотека pyspark_dist_explore
toPandas()
библиотека HandySpark
Библиотека Pyspark_dist_explore позволяет быстро анализировать DataFrames
Доступны три функции: hist(), distplot() и pandas_histogram()
test_df = spark.read.csv("test.csv", header=True, inferSchema=True)
test_df_age = test_df.select('Age')
hist(test_df_age, bins=20, color="red")
test_df = spark.read.csv("test.csv", header=True, inferSchema=True)
test_df_sample_pandas = test_df.toPandas()
test_df_sample_pandas.hist('Age')
toPandas() не рекомендуетсяPandas DataFrames хранятся в памяти одного сервера, тогда как операции PySpark выполняются параллельно
В pandas результат вычисляется сразу при выполнении операции, а в PySpark DataFrame применяется отложенное вычисление
Pandas DataFrame является изменяемым, а PySpark DataFrames — неизменяемыми
API pandas поддерживает больше операций, чем API PySpark DataFrame
test_df = spark.read.csv('test.csv', header=True, inferSchema=True)
hdf = test_df.toHandy()
hdf.cols["Age"].hist()
Основы Big Data с PySpark