데이터 엔지니어링 입문
Vincent Vankrunkelsven
Data Engineer @ DataCamp
분석

애플리케이션

분석

애플리케이션

대규모 병렬 처리(MPP) 데이터베이스

파일에서 컬럼형 저장 형식으로 로드
# Pandas .to_parquet() method
df.to_parquet("./s3://path/to/bucket/customer.parquet")
# PySpark .write.parquet() method
df.write.parquet("./s3://path/to/bucket/customer.parquet")
COPY customer
FROM 's3://path/to/bucket/customer.parquet'
FORMAT as parquet
...
pandas.to_sql()
# 데이터 변환
recommendations = transform_find_recommendatins(ratings_df)
# PostgreSQL에 적재
recommendations.to_sql("recommendations",
db_engine,
schema="store",
if_exists="replace")
데이터 엔지니어링 입문