Prognozy i ilorazy szans

Wprowadzenie do regresji z użyciem statsmodels w Pythonie

Maarten Van den Broeck

Content Developer at DataCamp

Prognozy z `regplot()`

sns.regplot(x="time_since_last_purchase",
            y="has_churned",
            data=churn,
            ci=None,
            logistic=True)

plt.show()

Wykres punktowy odejść klientów w zależności od czasu od ostatniego zakupu z logistyczną linią trendu.

Wprowadzenie do regresji z użyciem statsmodels w Pythonie

Tworzenie prognoz

mdl_recency = logit("has_churned ~ time_since_last_purchase",
                    data = churn).fit()


explanatory_data = pd.DataFrame( {"time_since_last_purchase": np.arange(-1, 6.25, 0.25)})
prediction_data = explanatory_data.assign( has_churned = mdl_recency.predict(explanatory_data))
Wprowadzenie do regresji z użyciem statsmodels w Pythonie

Dodawanie prognoz punktowych

sns.regplot(x="time_since_last_purchase",
            y="has_churned",
            data=churn,
            ci=None,
            logistic=True)

sns.scatterplot(x="time_since_last_purchase",
                y="has_churned",
                data=prediction_data,
                color="red")

plt.show()

Wykres punktowy odejść klientów w zależności od czasu od ostatniego zakupu z logistyczną linią trendu. Na wykresie zaznaczono wyniki z predict(), które dokładnie pokrywają się z linią trendu.

Wprowadzenie do regresji z użyciem statsmodels w Pythonie

Wyznaczanie najbardziej prawdopodobnego wyniku

prediction_data = explanatory_data.assign(
    has_churned = mdl_recency.predict(explanatory_data))

prediction_data["most_likely_outcome"] = np.round(prediction_data["has_churned"])
Wprowadzenie do regresji z użyciem statsmodels w Pythonie

Wizualizacja najbardziej prawdopodobnego wyniku

sns.regplot(x="time_since_last_purchase",
            y="has_churned",
            data=churn,
            ci=None,
            logistic=True)

sns.scatterplot(x="time_since_last_purchase",
                y="most_likely_outcome",
                data=prediction_data,
                color="red")

plt.show()

Wykres punktowy odejść klientów w zależności od czasu od ostatniego zakupu z logistyczną linią trendu. Na wykresie zaznaczono najbardziej prawdopodobne wyniki. Dla małych wartości czasu od ostatniego zakupu najbardziej prawdopodobny wynik to brak odejścia. Dla dużych wartości – odejście.

Wprowadzenie do regresji z użyciem statsmodels w Pythonie

Iloraz szans

Iloraz szans to prawdopodobieństwo zajścia zdarzenia podzielone przez prawdopodobieństwo jego niezajścia.

$$ \text{odds} = \frac{\text{probability}}{(1 - \text{probability)}} $$

$$ \text{odds} = \frac{0.25}{(1 - 0.25)} = \frac{1}{3} $$

Wykres liniowy ilorazu szans w zależności od prawdopodobieństwa. Krzywa rośnie asymptotycznie do nieskończoności, gdy prawdopodobieństwo dąży do jedynki.

Wprowadzenie do regresji z użyciem statsmodels w Pythonie

Obliczanie ilorazu szans

prediction_data["odds"] = prediction_data["has_churned"] / 
                            (1 - prediction_data["has_churned"])

Wprowadzenie do regresji z użyciem statsmodels w Pythonie

Wizualizacja ilorazu szans

sns.lineplot(x="time_since_last_purchase",
             y="odds",
             data=prediction_data)


plt.axhline(y=1, linestyle="dotted")
plt.show()

Wykres liniowy ilorazu szans w zależności od czasu od ostatniego zakupu z linią przy ilorazie szans równym jeden. Dla małych wartości czasu najbardziej prawdopodobny wynik to brak odejścia. Iloraz szans odejścia rośnie wraz z czasem, osiągając pięciokrotność szans braku odejścia.

Wprowadzenie do regresji z użyciem statsmodels w Pythonie

Wizualizacja logarytmu szans

sns.lineplot(x="time_since_last_purchase",
             y="odds",
             data=prediction_data)

plt.axhline(y=1,
            linestyle="dotted")
plt.yscale("log")

plt.show()

Wykres liniowy ilorazu szans w zależności od czasu od ostatniego zakupu z linią przy ilorazie szans równym jeden. Oś Y ma skalę logarytmiczną, dzięki czemu linia ilorazu szans stała się liniowa.

Wprowadzenie do regresji z użyciem statsmodels w Pythonie

Obliczanie logarytmu szans

prediction_data["log_odds"] = np.log(prediction_data["odds"])
Wprowadzenie do regresji z użyciem statsmodels w Pythonie

Wszystkie prognozy razem

time_since_last_prchs has_churned most_likely_rspns odds log_odds
0 0.491 0 0.966 -0.035
2 0.623 1 1.654 0.503
4 0.739 1 2.834 1.042
6 0.829 1 4.856 1.580
... ... ... ... ...
Wprowadzenie do regresji z użyciem statsmodels w Pythonie

Porównanie skal

Skala Łatwość interpretacji wartości Łatwość interpretacji zmian Precyzja
Prawdopodobieństwo
Najbardziej prawdopodobny wynik ✔✔
Iloraz szans
Logarytm szans
Wprowadzenie do regresji z użyciem statsmodels w Pythonie

Czas na ćwiczenia!

Wprowadzenie do regresji z użyciem statsmodels w Pythonie

Preparing Video For Download...