Bù đắp bằng trung bình, trung vị & mốt

Xử lý Dữ liệu Khuyết trong Python

Suraj Donthi

Deep Learning & Computer Vision Consultant

Kỹ thuật bù đắp cơ bản

  • hằng số (vd. 0)
  • trung bình
  • trung vị
  • mốt hoặc giá trị xuất hiện nhiều nhất
Xử lý Dữ liệu Khuyết trong Python

Bù đắp bằng trung bình

from sklearn.impute import SimpleImputer

diabetes_mean = diabetes.copy(deep=True)
mean_imputer = SimpleImputer(strategy='mean')
Xử lý Dữ liệu Khuyết trong Python

Bù đắp bằng trung bình

from sklearn.impute import SimpleImputer
diabetes_mean = diabetes.copy(deep=True)
mean_imputer = SimpleImputer(strategy='mean')
diabetes_mean.iloc[:, :] = mean_imputer.fit_transform(diabetes_mean)
Xử lý Dữ liệu Khuyết trong Python

Bù đắp bằng trung vị

diabetes_median = diabetes.copy(deep=True)
median_imputer = SimpleImputer(strategy='median')
diabetes_median.iloc[:, :] = median_imputer.fit_transform(diabetes_median)
Xử lý Dữ liệu Khuyết trong Python

Bù đắp bằng mốt

diabetes_mode = diabetes.copy(deep=True)
mode_imputer = SimpleImputer(strategy='most_frequent')
diabetes_mode.iloc[:, :] = mode_imputer.fit_transform(diabetes_mode)
Xử lý Dữ liệu Khuyết trong Python

Bù đắp hằng số

diabetes_constant = diabetes.copy(deep=True)
constant_imputer = SimpleImputer(strategy='constant', fill_value=0))
diabetes_constant.iloc[:, :] = constant_imputer.fit_transform(diabetes_constant)
Xử lý Dữ liệu Khuyết trong Python

Biểu đồ phân tán sau bù đắp

nullity = diabetes['Serum_Insulin'].isnull()+diabetes['Glucose'].isnull()
diabetes_mean.plot(x='Serum_Insulin', y='Glucose', kind='scatter', alpha=0.5,

c=nullity, cmap='rainbow', title='Mean Imputation')

Biểu đồ phân tán của dataframe tiểu đường sau bù trung bình

Xử lý Dữ liệu Khuyết trong Python

Trực quan hóa bù đắp

fig, axes = plt.subplots(nrows=2, ncols=2, figsize=(10, 10))

nullity = diabetes['Serum_Insulin'].isnull()+diabetes['Glucose'].isnull()
imputations = {'Mean Imputation': diabetes_mean, 'Median Imputation': diabetes_median, 'Most Frequent Imputation': diabetes_mode, 'Constant Imputation': diabetes_constant}
for ax, df_key in zip(axes.flatten(), imputations):
imputations[df_key].plot(x='Serum_Insulin', y='Glucose', kind='scatter', alpha=0.5, c=nullity, cmap='rainbow', ax=ax, colorbar=False, title=df_key)
Xử lý Dữ liệu Khuyết trong Python

Trực quan hóa các cách bù đắp trên dataframe tiểu đường

Xử lý Dữ liệu Khuyết trong Python

Tóm tắt

Bạn đã học cách

  • Bù đắp bằng tham số thống kê: trung bình, trung vị, mốt
  • So sánh các bù đắp bằng đồ thị
  • Phân tích các bù đắp
Xử lý Dữ liệu Khuyết trong Python

Ayo berlatih!

Xử lý Dữ liệu Khuyết trong Python

Preparing Video For Download...