대규모 데이터셋으로 머신 러닝

Python에서 Dask로 병렬 프로그래밍

James Fulton

Climate Informatics Researcher

데이터 로딩 및 전처리

# 표 형식 데이터셋 로드
import dask.dataframe as dd
dask_df = dd.read_parquet("dataset_parquet")
X = dask_df[['feature1', 'feature2', 'feature3']]
y = dask_df['target_column']
from dask_ml.preprocessing import StandardScaler

scaler = StandardScaler()

scaler.fit(X) # 지연 아님
standardized_X = scaler.transform(X) # 지연 실행
Python에서 Dask로 병렬 프로그래밍

학습/테스트 분할

from dask_ml.model_selection import train_test_split

X_train, X_test, y_train, y_test = train_test_split(X, y, shuffle=True, test_size=0.2)
print(X_train)
Dask DataFrame 구조:
        feature1    feature2    feature3
npartitions=7                               
           int64     float64     float64
             ...         ...         ...
Python에서 Dask로 병렬 프로그래밍

점수 계산

# 학습 데이터로 적합한 모델 평가
train_score = dask_model.score(X_train, y_train) # 지연 아님

print(train_score)
-0.12321
# 테스트 데이터로 모델 평가
test_score = dask_model.score(X_test, y_test)  # 지연 아님

print(test_score)
-0.23453
Python에서 Dask로 병렬 프로그래밍

실습해 봅시다!

Python에서 Dask로 병렬 프로그래밍

Preparing Video For Download...