Методи статистичного моделювання

Аналіз опитувальних даних у Python

EbunOluwa Andrew

Data Scientist

Навіщо використовувати статистичне моделювання в аналізі опитувань?

  • Прогнозуйте за зв'язками між змінними
  • Вмикайте інструменти візуалізації
    • Інсайти запам'ятовуються

Фото: Chris Liverani з Unsplash — чоловік тримає чорний смартфон з чорним екраном перед монітором

1 Фото: Chris Liverani з Unsplash
Аналіз опитувальних даних у Python

Коли застосовувати методи статистичного моделювання

  • Складні дані
  • Вплив між змінними
  • Прогноз результату

Фото: Tyler Easton з Unsplash — різні числа, надруковані на стіні

1 Фото: Tyler Easton з Unsplash
Аналіз опитувальних даних у Python

Приклади методів статистичного моделювання

  • Лінійна регресія
  • Двовибірковий t-тест
  • Критерій хі-квадрат

Фото: Алекс Арцибашев з Unsplash — зростаючі стовпчики

Аналіз опитувальних даних у Python

Модель лінійної регресії

  • Модель лінійної регресії
    • Припускає лінійний зв'язок між змінними x та y
    • y = m*x + b
    • y = залежна змінна
    • x = незалежна змінна
    • m = кутовий коефіцієнт
    • b = перетин з віссю y

Зображення з Seeing Theory-Brown.edu — лінія найкращого наближення серед точок

1 Зображення з Seeing Theory-Brown.edu
Аналіз опитувальних даних у Python

Лінійна регресія в аналізі опитувань

employee gender company_type wfh_available mental_fatigue_score burn_rate
fff200 Male Service No 3 0.24
fff500 Female Service Yes 5.7 0.45
fff700 Female Service Yes 5.8 0.49
fff300 Female Service Yes 6.7 0.63
fff100 Female Product Yes 4.7 0.38
fff400 Male Service Yes 3.4 0.28
fff600 Female Product Yes 5.4 0.5
fffe3400 Female Product No 6.7 0.58
fffe200 Male Service Yes 6.3 0.48
fffe3000 Male Service Yes 5.4 0.41
Аналіз опитувальних даних у Python

Лінійна регресія в аналізі опитувань

data.plot.scatter(
x='mental_fatigue_score',
y='burn_rate')
plt.show()

burn_rate проти mental_fatigue_score

Аналіз опитувальних даних у Python

Двовибірковий t-тест

  • Перевіряє статистично значущу різницю між двома середніми генеральних сукупностей
  • Нульова гіпотеза = середні двох сукупностей рівні
  • Альтернативна гіпотеза = середні двох сукупностей НЕ рівні

Фото: Olesia Bahrii з Unsplash — дві грона винограду

1 Фото: Olesia Bahrii з Unsplash
Аналіз опитувальних даних у Python

Двовибірковий t-тест в аналізі опитувань

employee gender company_type wfh_available mental_fatigue_score burn_rate
fff100 Female Product Yes 4.7 0.38
fff400 Male Service Yes 3.4 0.28
fff600 Female Product Yes 5.4 0.5
company_type burn_rate
Service 0.57
Service 0.75
Service 0.51
Service 0.57
company_type burn_rate
Product 0.51
Product 0.79
Product 0.66
Product 0.39
Аналіз опитувальних даних у Python

Критерій хі-квадрат

  • Перевіряє статистичну значущість зв'язку між двома категоріальними змінними
  • Нульова гіпотеза = нема значущої асоціації між змінними
  • Альтернативна гіпотеза = є значуща асоціація між змінними
Аналіз опитувальних даних у Python

Критерій хі-квадрат в аналізі опитувань

  • Змінна №1

    • company_type
    • Product або Service
  • Змінна №2

    • wfh_available
    • Yes або No
company_type wfh_available
Product Yes
Product Yes
Product No
Service Yes
Service Yes
Product Yes
Service No
Service No
Product Yes
Service Yes
Аналіз опитувальних даних у Python

Яку техніку обрати? — лінійна регресія

Обидві змінні = числові

діаграма розсіяння: calories проти minutes

Аналіз опитувальних даних у Python

Яку техніку обрати? — двовибірковий t-тест

  • Двовибірковий t-тест
    • Одна змінна = категоріальна
    • Одна змінна = числова

Фото: Diana Polekhina з Unsplash — біла й чорна рулетка на жовтому тлі

1 Фото: Diana Polekhina з Unsplash
Аналіз опитувальних даних у Python

Яку техніку обрати? — критерій хі-квадрат

  • Критерій хі-квадрат
    • Обидві змінні = категоріальні

Фото: Element5 Digital з Unsplash — силует голосування

1 Фото: Element5 Digital з Unsplash
Аналіз опитувальних даних у Python

Давайте потренуємось!

Аналіз опитувальних даних у Python

Preparing Video For Download...