Déchargement des données et connectivité

Automatisation des pipelines de données dans Snowflake

Emily Melhuish

Technical Curriculum Developer, Snowflake

Cas d'usage : déchargement

Exporter des données vers le cloud storage

  • Tous les partenaires n'ont pas accès à Snowflake
  • COPY INTO écrit directement vers un stage
  • Aucun pipeline d'export distinct requis
    COPY INTO @harbr_partner_export/
    daily_summary/
    FROM (SELECT * FROM 
    logistics.shipment_summary
    WHERE export_date = 
    CURRENT_DATE() - 1);
    

 

 

mermaid : déchargement Snowflake vers le stockage partenaire

Automatisation des pipelines de données dans Snowflake

COPY INTO

COPY INTO @harbr_partner_export/shipment_summary/
FROM (
  SELECT shipment_id,
         origin,
         destination,
         delivery_status,
         delivery_time_hours
  FROM logistics.shipments
  WHERE delivery_date = CURRENT_DATE()
)
FILE_FORMAT = (TYPE = 'CSV' HEADER = TRUE)
OVERWRITE = TRUE;
Automatisation des pipelines de données dans Snowflake

Formats de fichier d'export

 

Format Idéal pour
CSV Universel — presque tous les systèmes le lisent ; idéal pour les exports partenaires
JSON Préserve les structures imbriquées ; utile pour les consommateurs semi-structurés
Parquet Grands jeux analytiques ; compression colonne = fichiers plus petits, lectures plus rapides

Options clés de déchargement

-- Fractionner les gros exports en plusieurs fichiers (octets)
HEADER = TRUE              -- inclure les noms de colonnes en première ligne
OVERWRITE = TRUE           -- remplacer les fichiers existants à ce chemin
MAX_FILE_SIZE = 104857600  -- 100 Mo par fichier de sortie
Automatisation des pipelines de données dans Snowflake

Le paysage de la connectivité

Le paysage de la connectivité des connecteurs

Automatisation des pipelines de données dans Snowflake

Connecteurs Kafka et Spark

Connecteur Kafka

  • Les topics arrivent directement dans des tables Snowflake
  • Aucun fichier, aucune étape — utilise Snowpipe Streaming
  • Latence en secondes
# connector.properties (Kafka settings)
snowflake.topic2table.map=events:
delivery_events
snowflake.ingestion.method=
SNOWPIPE_STREAMING

Connecteur Spark

  • S'intègre à l'API DataFrame de Spark
  • Les jobs Spark lisent et écrivent dans Snowflake
  • Gère des transformations à grande échelle
// Read from Snowflake into a Spark DataFrame
val df = spark.read.format("snowflake")
  .options(sfOptions).option("dbtable", 
    "shipments").load()
Automatisation des pipelines de données dans Snowflake

Intégrations JDBC/ODBC et partenaires

Connectivité universelle

Intégration Type Usage chez Harbr
JDBC / ODBC Pilotes universels Outils BI (Tableau, Power BI, Looker) - requêtes directes
Connecteur Python Pilote Python natif Pipelines de données, ETL planifié, data science
dbt Transformation SQL Exécute les modèles directement sur le compute Snowflake
Fivetran / Airbyte Ingestion managée Sources SaaS → Snowflake, sans code personnalisé
Automatisation des pipelines de données dans Snowflake

Passons à la pratique !

Automatisation des pipelines de données dans Snowflake

Preparing Video For Download...