Introdução à Engenharia de Dados
Vincent Vankrunkelsven
Data Engineer, DataCamp
Analytics

Aplicações

Analytics

Aplicações

Bancos de dados de processamento massivo paralelo

Carregar de arquivo para formato de armazenamento colunar
# Método .to_parquet() do Pandas
df.to_parquet("s3://path/to/bucket/customer.parquet")
# Método .write.parquet() do PySpark
df.write.parquet("s3://path/to/bucket/customer.parquet")
COPY customer
FROM 's3://path/to/bucket/customer.parquet'
FORMAT as parquet
...
pandas.to_sql()
# Transformação nos dados
recommendations = transform_find_recommendatins(ratings_df)
# Carregar no banco PostgreSQL
recommendations.to_sql("recommendations",
db_engine,
schema="store",
if_exists="replace")
Introdução à Engenharia de Dados