Gegevensunloading en connectiviteit

Automatisering van datapijplijnen in Snowflake

Emily Melhuish

Technical Curriculum Developer, Snowflake

De unloading-usecase

Data exporteren naar cloudopslag

  • Niet alle partners hebben Snowflake-toegang
  • COPY INTO schrijft resultaten direct naar een stage
  • Geen aparte exportpijplijn nodig
    COPY INTO @harbr_partner_export/
    daily_summary/
    FROM (SELECT * FROM 
    logistics.shipment_summary
    WHERE export_date = 
    CURRENT_DATE() - 1);
    

 

 

mermaid: snowflake unloaden naar partneropslag

Automatisering van datapijplijnen in Snowflake

COPY INTO

COPY INTO @harbr_partner_export/shipment_summary/
FROM (
  SELECT shipment_id,
         origin,
         destination,
         delivery_status,
         delivery_time_hours
  FROM logistics.shipments
  WHERE delivery_date = CURRENT_DATE()
)
FILE_FORMAT = (TYPE = 'CSV' HEADER = TRUE)
OVERWRITE = TRUE;
Automatisering van datapijplijnen in Snowflake

Bestandsformaat voor export

 

Formaat Beste voor
CSV Universeel — bijna elk systeem leest dit; ideaal voor partnerexports
JSON Behoudt geneste structuren; handig voor semi-gestructureerde consumers
Parquet Grote analytische datasets; kolomcompressie = kleinere files, snellere reads

Belangrijke unloading-opties

-- Grote exports splitsen over meerdere files (bytes)
HEADER = TRUE              -- kolomnamen in eerste rij
OVERWRITE = TRUE           -- vervang bestaande files op dit pad
MAX_FILE_SIZE = 104857600  -- 100 MB per outputbestand
Automatisering van datapijplijnen in Snowflake

Het connectiviteitslandschap

Het connectiviteitslandschap connectors

Automatisering van datapijplijnen in Snowflake

Kafka- en Spark-connectors

Kafka-connector

  • Topics stromen direct naar Snowflake-tabellen
  • Geen files, geen stages — gebruikt Snowpipe Streaming
  • Latentie in seconden
# connector.properties (Kafka settings)
snowflake.topic2table.map=events:
delivery_events
snowflake.ingestion.method=
SNOWPIPE_STREAMING

Spark-connector

  • Integreert met Spark’s DataFrame-API
  • Spark-jobs lezen en schrijven naar Snowflake
  • Verwerkt grootschalige transformaties
// Read from Snowflake into a Spark DataFrame
val df = spark.read.format("snowflake")
  .options(sfOptions).option("dbtable", 
    "shipments").load()
Automatisering van datapijplijnen in Snowflake

JDBC/ODBC en partnerintegraties

Universele connectiviteit

Integratie Type Gebruik bij Harbr
JDBC / ODBC Universele drivers BI-tools (Tableau, Power BI, Looker) - direct query’en
Python Connector Native Python-driver Datapijplijnen, geplande ETL, data science-workflows
dbt SQL-transformatie Draait modellen direct op Snowflake compute
Fivetran / Airbyte Beheerde ingestie SaaS-bronnen → Snowflake, geen custom code
Automatisering van datapijplijnen in Snowflake

Laten we oefenen!

Automatisering van datapijplijnen in Snowflake

Preparing Video For Download...