การทำให้ Data Pipeline เป็นอัตโนมัติใน Snowflake
Emily Melhuish
Technical Curriculum Developer, Snowflake
การส่งออกข้อมูลไปยัง Cloud Storage
COPY INTO เขียนผลลัพธ์โดยตรงไปยัง stageCOPY INTO @harbr_partner_export/
daily_summary/
FROM (SELECT * FROM
logistics.shipment_summary
WHERE export_date =
CURRENT_DATE() - 1);

COPY INTO @harbr_partner_export/shipment_summary/
FROM (
SELECT shipment_id,
origin,
destination,
delivery_status,
delivery_time_hours
FROM logistics.shipments
WHERE delivery_date = CURRENT_DATE()
)
FILE_FORMAT = (TYPE = 'CSV' HEADER = TRUE)
OVERWRITE = TRUE;
| รูปแบบ | เหมาะสำหรับ |
|---|---|
| CSV | สากล - เกือบทุกระบบรองรับ; เหมาะสำหรับการส่งออกให้พาร์ทเนอร์ |
| JSON | รักษาโครงสร้างซ้อน; เหมาะสำหรับผู้รับข้อมูลแบบกึ่งโครงสร้าง |
| Parquet | ชุดข้อมูลวิเคราะห์ขนาดใหญ่; การบีบอัดแบบคอลัมน์ = ไฟล์เล็กลง อ่านเร็วขึ้น |
ตัวเลือกการยกเลิกโหลดที่สำคัญ
-- Split large exports across multiple files (bytes)
HEADER = TRUE -- include column names in first row
OVERWRITE = TRUE -- replace any existing files at that path
MAX_FILE_SIZE = 104857600 -- 100 MB per output file

Kafka Connector
# connector.properties (Kafka settings)
snowflake.topic2table.map=events:
delivery_events
snowflake.ingestion.method=
SNOWPIPE_STREAMING
Spark Connector
// Read from Snowflake into a Spark DataFrame
val df = spark.read.format("snowflake")
.options(sfOptions).option("dbtable",
"shipments").load()
การเชื่อมต่อแบบสากล
| การรวมระบบ | ประเภท | การใช้งานที่ Harbr |
|---|---|---|
| JDBC / ODBC | ไดรเวอร์สากล | เครื่องมือ BI (Tableau, Power BI, Looker) - สืบค้นโดยตรง |
| Python Connector | ไดรเวอร์ Python | ไปป์ไลน์ข้อมูล, ETL ตามกำหนด, งาน Data Science |
| dbt | การแปลง SQL | รันโมเดลใน Snowflake compute โดยตรง |
| Fivetran / Airbyte | การนำเข้าข้อมูลแบบจัดการ | ระบบต้นทาง SaaS → Snowflake ไม่ต้องเขียนโค้ด |
การทำให้ Data Pipeline เป็นอัตโนมัติใน Snowflake