Ресамплинг как особый вид симуляции Монте-Карло

Симуляции Монте-Карло на Python

Izzy Weber

Curriculum Manager, DataCamp

Ресамплинг как особый вид симуляции Монте-Карло

 

Симуляции Монте-Карло

  • Выборка из вероятностных распределений
  • Распределения известны или предполагаются
  • Опираются на исторические данные или экспертные знания

 

Ресамплинг

  • Случайная выборка из имеющихся данных
  • Данные выступают неявным вероятностным распределением
  • Предполагается репрезентативность данных
Симуляции Монте-Карло на Python

Методы ресамплинга

  1. Выборка без возврата
    • Используется для получения случайной выборки
  2. Выборка с возвратом (бутстрэппинг)
    • Применяется для оценки выборочного распределения почти любой статистики
  3. Перестановка
    • Часто используется для сравнения двух групп
Симуляции Монте-Карло на Python

Выборка без возврата

Случайный выбор двух штатов из шести штатов Новой Англии

import random
def two_random_ne_states():

ne_states=["Maine", "Vermont", "New Hampshire", "Massachusetts", "Connecticut", "Rhode Island"]
return(random.sample(ne_states, 2))

 

 

two_random_ne_states()
two_random_ne_states()
['Massachusetts', 'Connecticut']
['New Hampshire', 'Maine']
Симуляции Монте-Карло на Python

Бутстрэппинг

Оценка 95%-го доверительного интервала для среднего роста игроков НБА

import random
import numpy as np

nba_heights = [196, 191, 198, 216, 188, 185, 211, 201,
               188, 191, 201, 208, 191, 183, 196]
simu_heights = []

for i in range(1000): bootstrap_sample = random.choices(nba_heights, k=15) simu_heights.append(np.mean(bootstrap_sample))
upper = np.quantile(simu_heights, 0.975) lower = np.quantile(simu_heights, 0.025) print([np.mean(simu_heights), lower, upper])
[196.26666666666668, 191.8, 201.2]
Симуляции Монте-Карло на Python

Визуализация результатов бутстрэппинга

Библиотеки для визуализации:

  • seaborn
  • matplotlib
import seaborn as sns
import matplotlib.pyplot as plt

sns.displot(simu_heights)
plt.axvline(191.8, color="red")
plt.axvline(201.2, color="red")
plt.axvline(196.3, color="green")

 

график распределения смоделированного роста

Симуляции Монте-Карло на Python

Перестановка

Оценка 95%-го доверительного интервала для средней разницы роста игроков НБА и взрослых мужчин в США

us_heights = [165, 185, 179, 187, 193, 180, 178, 179, 171, 176, 
              169, 160, 140, 199, 176, 185, 175, 196, 190, 176]
nba_heights = [196, 191, 198, 216, 188, 185, 211, 201, 188, 191, 201, 208, 191, 183, 196]

all_heights = us_heights + nba_heights
simu_diff = [] for i in range(1000): perm_sample = np.random.permutation(all_heights) perm_nba, perm_adult = perm_sample[0:15], perm_sample[15:35]
perm_diff = np.mean(perm_nba) - np.mean(perm_adult) simu_diff.append(perm_diff)
Симуляции Монте-Карло на Python

Результаты перестановки

Разница средних значений роста игроков НБА и взрослых американцев:

np.mean(nba_heights) - np.mean(us_adult_height)
18.31666666666669

95%-й доверительный интервал для перестановки двух случайных списков:

upper = np.quantile(simu_diff, 0.975)
lower = np.quantile(simu_diff, 0.025)
print([lower, upper])
[-10.033333333333331, 10.033333333333331]
Симуляции Монте-Карло на Python

Визуализация результатов перестановки

sns.distplot(simu_diff)
plt.axvline(-10.03, color="red")
plt.axvline(10.03, color="red")
plt.axvline(18.32, color="green")

график распределения смоделированного роста

Симуляции Монте-Карло на Python

Давайте потренируемся!

Симуляции Монте-Карло на Python

Preparing Video For Download...