Programmation parallèle avec Dask en Python
James Fulton
Climate Informatics Researcher
# Charger un ensemble de données tabulaire
import dask.dataframe as dd
dask_df = dd.read_parquet("dataset_parquet")
X = dask_df[['feature1', 'feature2', 'feature3']]
y = dask_df['target_column']
from dask_ml.preprocessing import StandardScaler scaler = StandardScaler()scaler.fit(X) # Ce n'est pas paresseuxstandardized_X = scaler.transform(X) # Paresseux
from dask_ml.model_selection import train_test_splitX_train, X_test, y_train, y_test = train_test_split(X, y, shuffle=True, test_size=0.2)print(X_train)
Structure du DataFrame Dask :
feature1 feature2 feature3
npartitions=7
int64 float64 float64
... ... ...
# Évaluer le modèle ajusté sur les données d'entraînement train_score = dask_model.score(X_train, y_train) # Non paresseuxprint(train_score)
-0.12321
# Évaluer le modèle ajusté sur les données de test test_score = dask_model.score(X_test, y_test) # Non paresseuxprint(test_score)
-0.23453
Programmation parallèle avec Dask en Python