確率分布の選択

Pythonで学ぶモンテカルロ・シミュレーション

Izzy Weber

Curriculum Manager, DataCamp

最尤推定(MLE)

  • 当てはまりを測って分布を選ぶために用いる
    • データに対する尤度が最も高い分布が最適
  • SciPy の .nnlf() で負の対数尤度を計算
  • .nnlf() の値が低いほど当てはまりが良い
Pythonで学ぶモンテカルロ・シミュレーション

age 変数の分布を選ぶ

sns.histplot(dia["age"])

糖尿病データセットの age 変数のヒストグラム

Pythonで学ぶモンテカルロ・シミュレーション

候補分布

distributions = [st.laplace, st.norm, st.expon]

ラプラス分布の PDF

Pythonで学ぶモンテカルロ・シミュレーション

候補分布の比較

mles = []


for distribution in distributions: pars = distribution.fit(dia["age"])
mle = distribution.nnlf(pars, dia["age"])
mles.append(mle)
print(mles)
[1797.8467779878652, 1764.0693689033028, 1938.171599681118]
Pythonで学ぶモンテカルロ・シミュレーション

候補分布の選択

for var in ["age", "bmi", "bp", "tc", "ldl", "hdl", "tch", "ltg", "glu"]:

distributions = [st.laplace, st.norm, st.expon] mles = []
for distribution in distributions: pars = distribution.fit(dia[var]) mle = distribution.nnlf(pars, dia[var]) mles.append(mle)
best_fit = sorted(zip(distributions, mles), key=lambda d: d[1])[0] print(f"Best fit reached using {best_fit[0].name}, \ MLE value: {best_fit[1]}, for variable {var}")
Pythonで学ぶモンテカルロ・シミュレーション

評価結果

Best fit reached using norm, MLE value: 1764.0693689033028, for variable age
Best fit reached using norm, MLE value: 1283.356127017369, for variable bmi
Best fit reached using norm, MLE value: 1787.7746251622739, for variable bp
Best fit reached using norm, MLE value: 2193.1564373753627, for variable to
Best fit reached using norm, MLE value: 2136.0440476305284, for variable ldl
Best fit reached using norm, MLE value: 1758.1350738323013, for variable hdl
Best fit reached using norm, MLE value: 739.3762494786798, for variable tch
Best fit reached using norm, MLE value: 339.6620870566908, for variable ltg
Best fit reached using norm, MLE value: 1706.0467588930867, for variable glu
Pythonで学ぶモンテカルロ・シミュレーション

練習しましょう!

Pythonで学ぶモンテカルロ・シミュレーション

Preparing Video For Download...