Apprentissage Machine de bout en bout
Joshua Stapleton
Machine Learning Engineer
L'ensemble de données contient :
Préparation des données :
df.drop() pour les colonnesdf.dropna(how='all') pour les lignes# compter les valeurs manquantes
print(df['oldpeak'].isnull().sum())
# Supprimer les colonne(s) vide(s) et ligne(s)
columns_dropped = heart_disease_df.drop(['oldpeak'], axis='columns')
rows_and_columns_dropped = columns_dropped.dropna(how='all')
Que faire s'il manque seulement quelques valeurs ?
Imputation :
Stratégies
# Calculer la valeur moyenne du cholestérol
mean_value = heart_disease_df['chol'].mean()
# Remplir les valeurs manquantes de cholestérol avec la moyenne
heart_disease_df['chol'].fillna(mean_value, inplace=True)
Techniques avancées :
from sklearn.impute import KNNImputer
# Initialiser KNNImputer
imputer = KNNImputer(n_neighbors=2, weights="uniform")
# Effectuer l'imputation sur votre DataFrame
df_imputed['oldpeak'] = imputer.fit_transform(df['oldpeak'])
# Supprimer les lignes en double
heart_disease_duplicates_dropped = heart_disease_column_dropped.drop_duplicates()
Apprentissage Machine de bout en bout