R로 배우는 Machine Learning 기반 마케팅 분석
Verena Pflieger
Data Scientist at INWT Statistics

summary(multipleLM2)
Residual standard error: 13.87 on 4179 degrees of freedom
Multiple R-squared: 0.3522, Adjusted R-squared: 0.3504
F-statistic: 206.5 on 11 and 4179 DF, p-value: < 2.2e-16

stats 패키지의 AIC()MASS 패키지의 stepAIC()AIC(multipleLM2)
33950.45
head(clvData2)
# A tibble: 6 x 14
customerID nOrders nItems daysSinceLastOrder margin returnRatio
<int> <int> <int> <int> <dbl> <dbl>
1 2 16 40 2 57.62 0.18
2 3 1 5 124 29.69 1.00
3 4 15 30 68 56.26 0.16
4 5 23 41 103 58.84 0.03
5 6 2 4 104 29.31 0.00
6 7 6 10 41 35.72 0.06
#... with 8 more variables: shareOwnBrand <dbl>, shareVoucher <dbl>,
# shareSale <dbl>, gender <chr>, age <int>, marginPerOrder <dbl>,
# marginPerItem <dbl>, itemsPerOrder <dbl>
predMargin <- predict(multipleLM2,
newdata = clvData2)
head(predMargin)
1 2 3 4 5 6
51.10204 31.63335 51.90008 52.62200 36.65194 33.84383
mean(predMargin, na.rm = TRUE)
33.95147
| 선형 회귀 학습 내용 | |
|---|---|
| 학습한 내용... | 미래 고객 생애 가치 예측 방법 |
| 연속형 변수 모델링을 위한 선형 회귀 활용 방법 | |
| 모델링과 예측에 사용되는 변수명이 동일해야 함 |
| 모델에서 얻은 인사이트 | |
|---|---|
| 학습한 내용... | 1년 내 마진이 다음 해 마진의 좋은 예측 변수임 |
| 마지막 주문 이후 기간이 길수록 예상 마진이 낮아짐 | |
| 성별, 나이 등의 특성은 마진 예측에 유의미한 영향이 없는 것으로 보임 | |
| 기타... |
R로 배우는 Machine Learning 기반 마케팅 분석