一图胜千言

理解数据可视化

Richie Cotton

Data Evangelist at DataCamp

你将学到什么

  • 如何选择合适的图表?
  • 如何解读常见图表?
  • 绘图的最佳实践是什么?
理解数据可视化

获取洞见的三种方式

计算汇总统计

mean、median、standard deviation

运行模型

线性与逻辑回归

绘制图表

散点图、条形图、直方图

理解数据可视化

Datasaurus Dozen(十二龙)

away_x away_y bullseye_x bullseye_y ... x_shape_x x_shape_y
32.33 61.41 51.20 83.34 ... 38.34 92.47
53.42 26.19 58.97 85.50 ... 35.75 94.12
63.92 30.83 51.87 85.83 ... 32.77 88.52
70.29 82.53 48.18 85.05 ... 33.73 88.62
34.12 45.73 41.68 84.02 ... 37.24 83.72
67.67 37.11 37.89 82.57 ... 36.03 82.04
1 Matejka, J., & Fitzmaurice, G. (2017) https://www.autodeskresearch.com/publications/samestats
理解数据可视化

各数据集的 x 均值

dataset mean(x)
away 54.27
bullseye 54.27
circle 54.27
dino 54.26
dots 54.26
h_lines 54.26
high_lines 54.27
dataset mean(x)
slant_down 54.27
slant_up 54.27
star 54.27
v_lines 54.27
wide_lines 54.27
x_shape 54.26
理解数据可视化

各数据集的 x 与 y 均值

dataset mean(x) mean(y)
away 54.27 47.83
bullseye 54.27 47.83
circle 54.27 47.84
dino 54.26 47.83
dots 54.26 47.84
h_lines 54.26 47.83
high_lines 54.27 47.84
dataset mean(x) mean(y)
slant_down 54.27 47.84
slant_up 54.27 47.83
star 54.27 47.84
v_lines 54.27 47.84
wide_lines 54.27 47.83
x_shape 54.26 47.84
理解数据可视化

各数据集的标准差

dataset std_dev(x) std_dev(y)
away 16.77 26.94
bullseye 16.77 26.94
circle 16.76 26.93
dino 16.77 26.94
dots 16.77 26.93
h_lines 16.77 26.94
high_lines 16.77 26.94
dataset std_dev(x) std_dev(y)
slant_down 16.77 26.94
slant_up 16.77 26.94
star 16.77 26.93
v_lines 16.77 26.94
wide_lines 16.77 26.94
x_shape 16.77 26.93
理解数据可视化

Dinosaurus Dozen 中 13 个数据集的散点图。各数据集的形状彼此差异很大。

理解数据可视化

连续变量与分类型变量

连续型:通常为数值

  • 身高、气温、收入
理解数据可视化

连续变量与分类型变量

连续型:通常为数值

  • 身高、气温、收入

分类型:通常为文本

  • 眼睛颜色、国家、行业
理解数据可视化

连续变量与分类型变量

连续型:通常为数值

  • 身高、气温、收入

分类型:通常为文本

  • 眼睛颜色、国家、行业

可能二者皆可

  • 年龄是连续的,但年龄段是分类型
  • 时间是连续的,但月份是分类型
理解数据可视化

Let's practice!

理解数据可视化

Preparing Video For Download...