Ограничения корреляции

Введение в статистику на Python

Maggie Matsui

Content Developer, DataCamp

Нелинейные зависимости

диаграмма рассеяния переменных с квадратичной зависимостью

$$r = 0.18$$

Введение в статистику на Python

Нелинейные зависимости

Что видим мы:

диаграмма рассеяния переменных с квадратичной зависимостью и квадратичной линией тренда

Что видит коэффициент корреляции:

диаграмма рассеяния переменных с квадратичной зависимостью и линейной линией тренда

Введение в статистику на Python

Корреляция учитывает только линейные зависимости

Не применяйте корреляцию вслепую

df['x'].corr(df['y'])
0.081094

Всегда визуализируйте данные

диаграмма рассеяния переменных с квадратичной зависимостью

Введение в статистику на Python

Данные о сне млекопитающих

print(msleep)
                 name       genus   vore         order  ... sleep_cycle  awake  brainwt   bodywt
1             Cheetah    Acinonyx  carni     Carnivora  ...         NaN   11.9      NaN   50.000
2          Owl monkey       Aotus   omni      Primates  ...         NaN    7.0  0.01550    0.480
3     Mountain beaver  Aplodontia  herbi      Rodentia  ...         NaN    9.6      NaN    1.350
4 Greater short-ta...     Blarina   omni  Soricomorpha  ...    0.133333    9.1  0.00029    0.019
5                 Cow         Bos  herbi  Artiodactyla  ...    0.666667   20.0  0.42300  600.000
..                ...         ...    ...           ...  ...         ...    ...      ...      ...
79         Tree shrew      Tupaia   omni    Scandentia  ...    0.233333   15.1  0.00250    0.104
80 Bottle-nosed do...    Tursiops  carni       Cetacea  ...         NaN   18.8      NaN  173.330
81              Genet     Genetta  carni     Carnivora  ...         NaN   17.7  0.01750    2.000
82         Arctic fox      Vulpes  carni     Carnivora  ...         NaN   11.5  0.04450    3.380
83            Red fox      Vulpes  carni     Carnivora  ...    0.350000   14.2  0.05040    4.230
Введение в статистику на Python

Масса тела и время бодрствования

Диаграмма рассеяния: масса тела против времени бодрствования

msleep['bodywt'].corr(msleep['awake'])
0.3119801
Введение в статистику на Python

Распределение массы тела

Гистограмма переменной bodywt

Введение в статистику на Python

Логарифмическое преобразование

msleep['log_bodywt'] = np.log(msleep['bodywt'])

sns.lmplot(x='log_bodywt', y='awake', data=msleep, ci=None) plt.show()
msleep['log_bodywt'].corr(msleep['awake'])
0.5687943

Диаграмма рассеяния: логарифм массы тела против времени бодрствования

Введение в статистику на Python

Другие преобразования

  • Логарифмическое преобразование (log(x))
  • Преобразование квадратным корнем (sqrt(x))
  • Обратное преобразование (1 / x)

  • Их комбинации, например:

    • log(x) и log(y)
    • sqrt(x) и 1 / y
Введение в статистику на Python

Зачем применять преобразование?

  • Некоторые статистические методы требуют линейной зависимости между переменными
    • Коэффициент корреляции
    • Линейная регрессия

 

Introduction to Linear Modeling in Python

Введение в статистику на Python

Корреляция не означает причинно-следственную связь

                x коррелирует с y не означает, что x является причиной y

Диаграмма рассеяния: потребление маргарина на душу населения в США и уровень разводов в штате Мэн. Переменные сильно коррелируют: коэффициент корреляции равен 0,99

Введение в статистику на Python

Confounding

  Употребление кофе (x) со стрелкой к раку лёгких (y)

Введение в статистику на Python

Смешивающий фактор

  Употребление кофе (x) со стрелкой к раку лёгких (y); курение (смешивающий фактор) — сверху

Введение в статистику на Python

Смешивающий фактор

  Употребление кофе (x) со стрелкой к раку лёгких (y) и курением (смешивающий фактор). Двойная стрелка между курением и кофе с подписью «ассоциация».

Введение в статистику на Python

Смешивающий фактор

  Употребление кофе (x) со стрелкой к раку лёгких (y) и курением (смешивающий фактор). Двойная стрелка между курением и кофе с подписью «ассоциация». Стрелка от курения к раку лёгких с подписью «причинно-следственная связь»

Введение в статистику на Python

Смешивающий фактор

  Употребление кофе (x) с двойной стрелкой к раку лёгких (y) с подписью «ассоциация». Двойная стрелка между курением и кофе с подписью «ассоциация». Стрелка от курения к раку лёгких с подписью «причинно-следственная связь».

  Праздники (x) со стрелкой к розничным продажам (y). Специальные акции (смешивающий фактор) с двойной стрелкой к праздникам и одинарной стрелкой к розничным продажам.

Введение в статистику на Python

Давайте потренируемся!

Введение в статистику на Python

Preparing Video For Download...