用 Python 练习机器学习面试题
Lisa Stuart
Data Scientist

| 方法 | 用 ML 模型 | 选最优子集 | 易过拟合 |
|---|---|---|---|
| 过滤法 | 否 | 否 | 否 |
| 包裹法 | 是 | 是 | 有时 |
| 嵌入法 | 是 | 是 | 是 |
| 特征重要性 | 是 | 是 | 是 |
| 特征/响应 | 连续型 | 分类型 |
|---|---|---|
| 连续型 | 皮尔逊相关 | LDA |
| 分类型 | 方差分析(ANOVA) | 卡方检验 |
| 函数 | 返回 |
|---|---|
df.corr() |
皮尔逊相关矩阵 |
sns.heatmap(corr_object) |
热力图 |
abs() |
绝对值 |

sklearn.ensemble.RandomForestRegressorsklearn.ensemble.ExtraTreesRegressortree_mod.feature_importances_| 函数 | 返回 |
|---|---|
sklearn.svm.SVR |
支持向量回归估计器 |
sklearn.feature_selection.RFECV |
带交叉验证的递归特征消除 |
rfe_mod.support_ |
已选特征的布尔数组 |
ref_mod.ranking_ |
特征排名,选中=1 |
sklearn.linear_model.LinearRegression |
线性模型估计器 |
sklearn.linear_model.LarsCV |
带交叉验证的最小角回归 |
LarsCV.score |
R² 分数 |
LarsCV.alpha_ |
估计的正则化参数 |
用 Python 练习机器学习面试题