用 Python 練習機器學習面試題
Lisa Stuart
Data Scientist

| 方法 | 使用 ML 模型 | 選最佳子集 | 可能過度擬合 |
|---|---|---|---|
| Filter | No | No | No |
| Wrapper | Yes | Yes | Sometimes |
| Embedded | Yes | Yes | Yes |
| 特徵重要性 | Yes | Yes | Yes |
| 特徵/應變數 | 連續型 | 類別型 |
|---|---|---|
| 連續型 | Pearson 相關 | LDA |
| 類別型 | ANOVA | 卡方檢定 |
| 函式 | 傳回 |
|---|---|
df.corr() |
Pearson 相關矩陣 |
sns.heatmap(corr_object) |
熱度圖 |
abs() |
絕對值 |

sklearn.ensemble.RandomForestRegressorsklearn.ensemble.ExtraTreesRegressortree_mod.feature_importances_| 函式 | 傳回 |
|---|---|
sklearn.svm.SVR |
支援向量迴歸估計器 |
sklearn.feature_selection.RFECV |
交叉驗證的遞迴式特徵消除 |
rfe_mod.support_ |
已選特徵的布林陣列 |
ref_mod.ranking_ |
特徵排名,選取=1 |
sklearn.linear_model.LinearRegression |
線性模型估計器 |
sklearn.linear_model.LarsCV |
交叉驗證的最小角度迴歸 |
LarsCV.score |
決定係數 r-squared 分數 |
LarsCV.alpha_ |
預估正規化參數 |
用 Python 練習機器學習面試題