Automatisation des pipelines de données dans Snowflake
Emily Melhuish
Technical Curriculum Developer, Snowflake
CDC : capture de données modifiées

Ce que fait un flux

| Type de flux | Capture | Idéal pour |
|---|---|---|
| Standard | Tous types de tables et vues & tous changements DML — insertions, mises à jour, suppressions | Tables où n’importe quelle ligne peut changer (ex. expéditions) |
| Ajouts seulement | Tous types de tables et vues, sauf tables externes — insertions uniquement | Tables en insertion unique (ex. événements de livraison) — plus efficace |
| Insert-only | Tables Apache Iceberg gérées à l’externe et tables externes — insertions uniquement | Tables externes |
Les tables d’annuaire exposent les métadonnées de fichiers d’un stage (nom, taille, horodatage de modification)
Flux standard sur la table shipments
CREATE STREAM shipments_stream
ON TABLE logistics.shipments;
Flux ajouts seulement sur la table delivery_events
CREATE STREAM delivery_events_stream
ON TABLE logistics.delivery_events
APPEND_ONLY = TRUE;
SELECT product, quantity, METADATA$ACTION, METADATA$ISUPDATE, METADATA$ROW_ID
FROM shipments_stream;
METADATA$ACTION : INSERT ou DELETEMETADATA$ISUPDATE : TRUE quand c’est une paire de mise à jourMETADATA$ROW_ID : Identifiant physique unique de la ligneMETADATA$ISUPDATE = TRUE


CREATE TASK logistics.sync_shipments
WAREHOUSE = compute_wh
SCHEDULE = '5 MINUTE'
WHEN SYSTEM$STREAM_HAS_DATA('logistics.staging_shipments_stream')
AS
INSERT INTO logistics.shipments
SELECT shipment_id, region, carrier, delivery_days
FROM logistics.staging_shipments_stream
WHERE METADATA$ACTION = 'INSERT';
Automatisation des pipelines de données dans Snowflake