データエンジニアリング入門
Vincent Vankrunkelsven
Data Engineer @ DataCamp
アナリティクス

アプリケーション

アナリティクス

アプリケーション

大規模並列処理(MPP)データベース

ファイルから列指向形式へ読み込み
# Pandas の .to_parquet() メソッド
df.to_parquet("./s3://path/to/bucket/customer.parquet")
# PySpark の .write.parquet() メソッド
df.write.parquet("./s3://path/to/bucket/customer.parquet")
COPY customer
FROM 's3://path/to/bucket/customer.parquet'
FORMAT as parquet
...
pandas.to_sql()
# データ変換
recommendations = transform_find_recommendatins(ratings_df)
# PostgreSQL へロード
recommendations.to_sql("recommendations",
db_engine,
schema="store",
if_exists="replace")
データエンジニアリング入門