Основи Big Data з PySpark
Upendra Devisetty
Science Analyst, CyVerse
Візуалізація даних — це подання даних у вигляді графіків або діаграм
Open-source інструменти для візуалізації в Python:
Побудова графіків із PySpark DataFrame здійснюється трьома способами
бібліотека pyspark_dist_explore
toPandas()
бібліотека HandySpark
Бібліотека Pyspark_dist_explore швидко дає уявлення про DataFrame
Нині доступні три функції: hist(), distplot(), і pandas_histogram()
test_df = spark.read.csv("test.csv", header=True, inferSchema=True)
test_df_age = test_df.select('Age')
hist(test_df_age, bins=20, color="red")
test_df = spark.read.csv("test.csv", header=True, inferSchema=True)
test_df_sample_pandas = test_df.toPandas()
test_df_sample_pandas.hist('Age')
toPandas() не рекомендованоPandas DataFrame — це структурa в пам'яті на одному сервері, а операції в PySpark виконуються паралельно
У Pandas результат обчислюється одразу, тоді як у PySpark DataFrame діє «ледаче» обчислення
Pandas DataFrame — змінні, а PySpark DataFrame — незмінні
API Pandas підтримує більше операцій, ніж API PySpark DataFrame
test_df = spark.read.csv('test.csv', header=True, inferSchema=True)
hdf = test_df.toHandy()
hdf.cols["Age"].hist()
Основи Big Data з PySpark