स्टेज, फ़ाइल फ़ॉर्मैट, और COPY INTO

Snowflake में डेटा पाइपलाइन ऑटोमेशन

Emily Melhuish

Technical Curriculum Developer, Snowflake

Snowflake अनेक वर्कलोड्स को संचालित करता है

स्क्रीनशॉट 2026-05-11 को 11.52.34 am.png

1 * Snowflake शिक्षण सामग्री
Snowflake में डेटा पाइपलाइन ऑटोमेशन

उदाहरण पाइपलाइन

 

 

स्क्रीनशॉट 2026-05-11 को 10.48.51 am.png

1 * Snowflake शिक्षण सामग्री
Snowflake में डेटा पाइपलाइन ऑटोमेशन

Harbr से मिलें

Harbr के लिए नकली लोगो

Harbr के बारे में

  • वैश्विक लॉजिस्टिक्स व सप्लाई-चेन प्लेटफ़ॉर्म
  • शिपमेंट, वेयरहाउस इन्वेंटरी, और डिलीवरी प्रदर्शन ट्रैक करने हेतु Snowflake का उपयोग
  • कई क्षेत्रों में आपूर्तिकर्ता सिस्टम से डेटा इनजेस्ट करता है
Snowflake में डेटा पाइपलाइन ऑटोमेशन

डेटा लोडिंग समस्या

डेटा लोडिंग आरेख

स्टेज = अस्थायी स्टोरेज स्थान

Snowflake में डेटा पाइपलाइन ऑटोमेशन

स्टेज के प्रकार

दो स्टेज प्रकार

आंतरिक स्टेज

  • उपयोगकर्ता
    • एकल उपयोगकर्ता के लिए निजी staging क्षेत्र
  • टेबल
    • किसी विशिष्ट टेबल से जुड़ा
  • नामित
    • स्कीमा में बनाया जाने वाला डेटाबेस ऑब्जेक्ट

बाहरी स्टेज

  • नामित
    • क्लाउड प्रदाता की ओर संकेत करता है
Snowflake में डेटा पाइपलाइन ऑटोमेशन

स्टेज पैरामीटर

डायरेक्टरी टेबल

CREATE STAGE harbr_stage
  DIRECTORY = (ENABLE = TRUE)

आंतरिक स्टेज एन्क्रिप्शन

ENCRYPTION = (TYPE = SNOWFLAKE_FULL)
ENCRYPTION = (TYPE = SNOWFLAKE_SSE)

बाहरी स्टेज एन्क्रिप्शन

ENCRYPTION = 
([ TYPE = 'AWS_CSE' ] MASTER_KEY = '') 

ENCRYPTION = 
([ TYPE = 'AWS_SSE_S3' ]) 

...
Snowflake में डेटा पाइपलाइन ऑटोमेशन

फ़ाइल फ़ॉर्मैट

  • संरचित फ़ॉर्मैट: CSV (डिलीमीटर, हेडर, क्वोटिंग नियम)
  • अर्ध-संरचित: JSON, Parquet, Avro, ORC, XML

    • सीधे VARIANT कॉलम में लोड करें
    • पार्सिंग नियम एक बार सेट करें, सभी लोड में दोहराएँ
  • फ़ॉर्मैट ऑब्जेक्ट एक बार अपडेट करें

SQL

CREATE FILE FORMAT harbr_csv_format
  TYPE = 'CSV'
  FIELD_DELIMITER = ','
  SKIP_HEADER = 1;
Snowflake में डेटा पाइपलाइन ऑटोमेशन

COPY INTO

नामित स्टेज और नामित फ़ाइल फ़ॉर्मैट से लोड करें

COPY INTO logistics.shipments
FROM @harbr_internal_stage/shipments/
FILE_FORMAT = (FORMAT_NAME = 'harbr_csv_format')
Snowflake में डेटा पाइपलाइन ऑटोमेशन

त्रुटि प्रबंधन

ON_ERROR विकल्प व्यवहार
ABORT_STATEMENT पहली त्रुटि पर पूरा लोड फेल (डिफ़ॉल्ट)
CONTINUE खराब पंक्तियाँ छोड़ें, बाकी लोड करें
SKIP_FILE किसी भी त्रुटि पर पूरा फ़ाइल छोड़ें
SKIP_FILE_<num> त्रुटियाँ गिनती सीमा से अधिक हों तो ही फ़ाइल छोड़ें
SKIP_FILE_<num>% त्रुटियाँ % सीमा से अधिक हों तो ही फ़ाइल छोड़ें
Snowflake में डेटा पाइपलाइन ऑटोमेशन

Validation mode और COPY_HISTORY

लोड किए बिना जाँचें = dry run

COPY INTO logistics.shipments
FROM @harbr_internal_stage/shipments/
FILE_FORMAT = (FORMAT_NAME = 'harbr_csv_format')
VALIDATION_MODE = RETURN_ERRORS;

लोड इतिहास देखें

SELECT * FROM TABLE(INFORMATION_SCHEMA.COPY_HISTORY(
  TABLE_NAME => 'shipments',
  START_TIME => DATEADD('hour', -24,
    CURRENT_TIMESTAMP())));
Snowflake में डेटा पाइपलाइन ऑटोमेशन

आइए अभ्यास करें!

Snowflake में डेटा पाइपलाइन ऑटोमेशन

Preparing Video For Download...