Data Engineering เบื้องต้น
Vincent Vankrunkelsven
Data Engineer, DataCamp
การวิเคราะห์ข้อมูล

แอปพลิเคชัน

การวิเคราะห์ข้อมูล

แอปพลิเคชัน

ฐานข้อมูลแบบ Massively Parallel Processing

โหลดจากไฟล์ไปยังรูปแบบการจัดเก็บแบบคอลัมน์
# Pandas .to_parquet() method
df.to_parquet("s3://path/to/bucket/customer.parquet")
# PySpark .write.parquet() method
df.write.parquet("s3://path/to/bucket/customer.parquet")
COPY customer
FROM 's3://path/to/bucket/customer.parquet'
FORMAT as parquet
...
pandas.to_sql()
# Transformation on data
recommendations = transform_find_recommendatins(ratings_df)
# Load into PostgreSQL database
recommendations.to_sql("recommendations",
db_engine,
schema="store",
if_exists="replace")
Data Engineering เบื้องต้น