一張圖勝千言

理解資料視覺化

Richie Cotton

Data Evangelist at DataCamp

你將學到什麼

  • 如何選擇合適的圖表?
  • 如何解讀常見圖表?
  • 繪圖的最佳實務為何?
理解資料視覺化

取得洞見的三種方式

計算摘要統計

mean、median、standard deviation

執行模型

linear 與 logistic regression

繪製圖表

scatter、bar、histogram

理解資料視覺化

Datasaurus Dozen

away_x away_y bullseye_x bullseye_y ... x_shape_x x_shape_y
32.33 61.41 51.20 83.34 ... 38.34 92.47
53.42 26.19 58.97 85.50 ... 35.75 94.12
63.92 30.83 51.87 85.83 ... 32.77 88.52
70.29 82.53 48.18 85.05 ... 33.73 88.62
34.12 45.73 41.68 84.02 ... 37.24 83.72
67.67 37.11 37.89 82.57 ... 36.03 82.04
1 Matejka, J., & Fitzmaurice, G. (2017) https://www.autodeskresearch.com/publications/samestats
理解資料視覺化

各資料集的 x 平均值

dataset mean(x)
away 54.27
bullseye 54.27
circle 54.27
dino 54.26
dots 54.26
h_lines 54.26
high_lines 54.27
dataset mean(x)
slant_down 54.27
slant_up 54.27
star 54.27
v_lines 54.27
wide_lines 54.27
x_shape 54.26
理解資料視覺化

各資料集的 x 與 y 平均值

dataset mean(x) mean(y)
away 54.27 47.83
bullseye 54.27 47.83
circle 54.27 47.84
dino 54.26 47.83
dots 54.26 47.84
h_lines 54.26 47.83
high_lines 54.27 47.84
dataset mean(x) mean(y)
slant_down 54.27 47.84
slant_up 54.27 47.83
star 54.27 47.84
v_lines 54.27 47.84
wide_lines 54.27 47.83
x_shape 54.26 47.84
理解資料視覺化

各資料集的標準差

dataset std_dev(x) std_dev(y)
away 16.77 26.94
bullseye 16.77 26.94
circle 16.76 26.93
dino 16.77 26.94
dots 16.77 26.93
h_lines 16.77 26.94
high_lines 16.77 26.94
dataset std_dev(x) std_dev(y)
slant_down 16.77 26.94
slant_up 16.77 26.94
star 16.77 26.93
v_lines 16.77 26.94
wide_lines 16.77 26.94
x_shape 16.77 26.93
理解資料視覺化

Dinosaurus Dozen 中 13 個資料集的散佈圖。每個資料集的外觀都彼此不同。

理解資料視覺化

連續與類別變數

連續型:通常是數值

  • 身高、溫度、營收
理解資料視覺化

連續與類別變數

連續型:通常是數值

  • 身高、溫度、營收

類別型:通常是文字

  • 眼睛顏色、國家、產業
理解資料視覺化

連續與類別變數

連續型:通常是數值

  • 身高、溫度、營收

類別型:通常是文字

  • 眼睛顏色、國家、產業

兩者皆可

  • 年齡是連續型,但年齡組屬於類別型
  • 時間是連續型,但月份屬於類別型
理解資料視覺化

一起來練習吧!

理解資料視覺化

Preparing Video For Download...