Data Engineering 入门
Vincent Vankrunkelsven
Data Engineer @ DataCamp
分析

应用

分析

应用

大规模并行处理(MPP)数据库

从文件加载为列式存储格式
# Pandas .to_parquet() 方法
df.to_parquet("./s3://path/to/bucket/customer.parquet")
# PySpark .write.parquet() 方法
df.write.parquet("./s3://path/to/bucket/customer.parquet")
COPY customer
FROM 's3://path/to/bucket/customer.parquet'
FORMAT as parquet
...
pandas.to_sql()
# 数据转换
recommendations = transform_find_recommendatins(ratings_df)
# 加载到 PostgreSQL 数据库
recommendations.to_sql("recommendations",
db_engine,
schema="store",
if_exists="replace")
Data Engineering 入门