Podstawy Big Data z PySpark
Upendra Devisetty
Science Analyst, CyVerse
Wizualizacja danych to przedstawianie danych w postaci wykresów lub diagramów
Narzędzia open source do wizualizacji w Pythonie:
Wykresy z PySpark DataFrames można tworzyć trzema metodami
biblioteka pyspark_dist_explore
toPandas()
biblioteka HandySpark
Biblioteka Pyspark_dist_explore umożliwia szybki wgląd w DataFrames
Dostępne są trzy funkcje: hist(), distplot() oraz pandas_histogram()
test_df = spark.read.csv("test.csv", header=True, inferSchema=True)
test_df_age = test_df.select('Age')
hist(test_df_age, bins=20, color="red")
test_df = spark.read.csv("test.csv", header=True, inferSchema=True)
test_df_sample_pandas = test_df.toPandas()
test_df_sample_pandas.hist('Age')
toPandas() nie jest zalecanePandas DataFrames działają w pamięci na jednym serwerze, natomiast operacje PySpark są wykonywane równolegle
W Pandas wyniki są generowane natychmiast, a operacje na PySpark DataFrame są wykonywane z opóźnieniem (lazy evaluation)
Pandas DataFrames są mutowalne, a PySpark DataFrames są niemutowalne
Pandas API obsługuje więcej operacji niż PySpark DataFrame API
test_df = spark.read.csv('test.csv', header=True, inferSchema=True)
hdf = test_df.toHandy()
hdf.cols["Age"].hist()
Podstawy Big Data z PySpark