Automatisering van datapijplijnen in Snowflake
Emily Melhuish
Technical Curriculum Developer, Snowflake
Data exporteren naar cloudopslag
COPY INTO schrijft resultaten direct naar een stageCOPY INTO @harbr_partner_export/
daily_summary/
FROM (SELECT * FROM
logistics.shipment_summary
WHERE export_date =
CURRENT_DATE() - 1);

COPY INTO @harbr_partner_export/shipment_summary/
FROM (
SELECT shipment_id,
origin,
destination,
delivery_status,
delivery_time_hours
FROM logistics.shipments
WHERE delivery_date = CURRENT_DATE()
)
FILE_FORMAT = (TYPE = 'CSV' HEADER = TRUE)
OVERWRITE = TRUE;
| Formaat | Beste voor |
|---|---|
| CSV | Universeel — bijna elk systeem leest dit; ideaal voor partnerexports |
| JSON | Behoudt geneste structuren; handig voor semi-gestructureerde consumers |
| Parquet | Grote analytische datasets; kolomcompressie = kleinere files, snellere reads |
Belangrijke unloading-opties
-- Grote exports splitsen over meerdere files (bytes)
HEADER = TRUE -- kolomnamen in eerste rij
OVERWRITE = TRUE -- vervang bestaande files op dit pad
MAX_FILE_SIZE = 104857600 -- 100 MB per outputbestand

Kafka-connector
# connector.properties (Kafka settings)
snowflake.topic2table.map=events:
delivery_events
snowflake.ingestion.method=
SNOWPIPE_STREAMING
Spark-connector
// Read from Snowflake into a Spark DataFrame
val df = spark.read.format("snowflake")
.options(sfOptions).option("dbtable",
"shipments").load()
Universele connectiviteit
| Integratie | Type | Gebruik bij Harbr |
|---|---|---|
| JDBC / ODBC | Universele drivers | BI-tools (Tableau, Power BI, Looker) - direct query’en |
| Python Connector | Native Python-driver | Datapijplijnen, geplande ETL, data science-workflows |
| dbt | SQL-transformatie | Draait modellen direct op Snowflake compute |
| Fivetran / Airbyte | Beheerde ingestie | SaaS-bronnen → Snowflake, geen custom code |
Automatisering van datapijplijnen in Snowflake