scikit-learn による教師あり学習
George Boorman
Core Curriculum Manager, DataCamp
$y = ax + b$
単純線形回帰は1つの特徴量を使用する
$y$ = ターゲット
$x$ = 単一の特徴量
$a$, $b$ = モデルのパラメータ/係数 - 傾き、切片
$a$ と $b$ の選択方法
任意の直線に対する誤差関数を定義する
誤差関数を最小にする線を選択する
誤差関数 = 損失関数 = コスト関数






$RSS = $ $\displaystyle\sum_{i=1}^{n}(y_i-\hat{y_i})^2$
最小二乗法(OLS):RSSを最小化
$$ y = a_{1}x_{1} + a_{2}x_{2} + b$$
$$ y = a_{1}x_{1} + a_{2}x_{2} + a_{3}x_{3} +... + a_{n}x_{n}+ b$$
from sklearn.model_selection import train_test_split from sklearn.linear_model import LinearRegressionX_train, X_test, y_train, y_test = train_test_split(X, y, test_size=0.3, random_state=42)reg_all = LinearRegression()reg_all.fit(X_train, y_train)y_pred = reg_all.predict(X_test)
$R^2$:特徴量によって説明される目的変数の分散を定量化する
$R^2$ が大きい場合:


reg_all.score(X_test, y_test)
0.356302876407827
$MSE = $ $\displaystyle\frac{1}{n}\sum_{i=1}^{n}(y_i-\hat{y_i})^2$
$RMSE = $ $\sqrt{MSE}$
from sklearn.metrics import root_mean_squared_errorroot_mean_squared_error(y_test, y_pred)
24.028109426907236
scikit-learn による教師あり学習