Déchargement des données et connectivité

Automatisation des pipelines de données dans Snowflake

Emily Melhuish

Technical Curriculum Developer, Snowflake

Cas d’usage : déchargement

Exporter des données vers un stockage infonuagique

  • Tous les partenaires n’ont pas accès à Snowflake
  • COPY INTO écrit directement vers un stage
  • Aucun pipeline d’export distinct requis
    COPY INTO @harbr_partner_export/
    daily_summary/
    FROM (SELECT * FROM 
    logistics.shipment_summary
    WHERE export_date = 
    CURRENT_DATE() - 1);
    

 

 

mermaid : déchargement Snowflake vers le stockage du partenaire

Automatisation des pipelines de données dans Snowflake

COPY INTO

COPY INTO @harbr_partner_export/shipment_summary/
FROM (
  SELECT shipment_id,
         origin,
         destination,
         delivery_status,
         delivery_time_hours
  FROM logistics.shipments
  WHERE delivery_date = CURRENT_DATE()
)
FILE_FORMAT = (TYPE = 'CSV' HEADER = TRUE)
OVERWRITE = TRUE;
Automatisation des pipelines de données dans Snowflake

Options de format de fichier d’export

 

Format Idéal pour
CSV Universel — presque tous les systèmes le lisent; idéal pour les exports partenaires
JSON Préserve les structures imbriquées; utile pour des consommateurs semi-structurés
Parquet Grands ensembles analytiques; compression en colonnes = fichiers plus petits, lectures plus rapides

Options clés de déchargement

-- Scinder les gros exports en plusieurs fichiers (octets)
HEADER = TRUE              -- inclure les noms de colonnes à la première ligne
OVERWRITE = TRUE           -- remplacer les fichiers existants à ce chemin
MAX_FILE_SIZE = 104857600  -- 100 Mo par fichier
Automatisation des pipelines de données dans Snowflake

Le paysage de la connectivité

Le paysage de la connectivité, connecteurs

Automatisation des pipelines de données dans Snowflake

Connecteurs Kafka et Spark

Connecteur Kafka

  • Les topics s’acheminent directement vers des tables Snowflake
  • Sans fichiers ni stages — utilise Snowpipe Streaming
  • Latence en secondes
# connector.properties (paramètres Kafka)
snowflake.topic2table.map=events:
delivery_events
snowflake.ingestion.method=
SNOWPIPE_STREAMING

Connecteur Spark

  • S’intègre à l’API DataFrame de Spark
  • Les jobs Spark lisent et écrivent dans Snowflake
  • Gère des transformations à grande échelle
// Lire depuis Snowflake dans un DataFrame Spark
val df = spark.read.format("snowflake")
  .options(sfOptions).option("dbtable", 
    "shipments").load()
Automatisation des pipelines de données dans Snowflake

Intégrations JDBC/ODBC et partenaires

Connectivité universelle

Intégration Type Usage chez Harbr
JDBC / ODBC Pilotes universels Outils BI (Tableau, Power BI, Looker) — requêtes directes
Connecteur Python Pilote Python natif Pipelines de données, ETL planifiés, science des données
dbt Transformation SQL Exécute des modèles directement sur Snowflake compute
Fivetran / Airbyte Ingestion gérée Sources SaaS → Snowflake, sans code personnalisé
Automatisation des pipelines de données dans Snowflake

Passons à la pratique !

Automatisation des pipelines de données dans Snowflake

Preparing Video For Download...