Introduction à l'ingénierie des données
Vincent Vankrunkelsven
Data Engineer, DataCamp
Analytique

Applications

Analytique

Applications

Bases de données à traitement massivement parallèle

Charger d'un fichier vers un format de stockage en colonnes
# Méthode Pandas .to_parquet()
df.to_parquet("s3://path/to/bucket/customer.parquet")
# Méthode PySpark .write.parquet()
df.write.parquet("s3://path/to/bucket/customer.parquet")
COPY customer
FROM 's3://path/to/bucket/customer.parquet'
FORMAT as parquet
...
pandas.to_sql()
# Transformation des données
recommendations = transform_find_recommendatins(ratings_df)
# Chargement dans une base PostgreSQL
recommendations.to_sql("recommendations",
db_engine,
schema="store",
if_exists="replace")
Introduction à l'ingénierie des données