Kỹ thuật dữ liệu trong Microsoft Fabric
Biến đổi và Phân tích Dữ liệu với Microsoft Fabric
Luis Silva
Solution Architect - Data & AI
Phân tích dữ liệu End-to-End
Nạp dữ liệu từ nguồn và lưu vào data lake
Chuẩn bị và chuyển đổi dữ liệu
Trực quan hóa và phân tích dữ liệu
Data Factory
Nạp, chuẩn bị và chuyển đổi dữ liệu
Dataflows và Data Pipelines
Dataflow
Giao diện low-code để nạp và chuyển đổi dữ liệu
Động cơ chuyển đổi Power Query
Data Pipelines
Tập hợp hoạt động thực hiện một tác vụ
Loại hoạt động:
Di chuyển dữ liệu (Copy activity, Dataflow)
Chuyển đổi dữ liệu (Notebook, Stored Procedure, Script)
Điều khiển (Switch, If, ForEach, Wait)
Synapse Data Engineering
Lakehouse
Notebook
Định nghĩa Apache Spark Job
Lakehouse
Dữ liệu có cấu trúc (bảng)
Dữ liệu phi cấu trúc (tệp)
Notebook
Giao diện web tương tác
Mã thao tác dữ liệu
Trực quan hóa dữ liệu
Ghi chú / Giải thích
Hỗ trợ đa ngôn ngữ:
PySpark (Python)
Spark (Scala)
Spark SQL (SQL)
SparkR (R)
Định nghĩa Apache Spark Job
Gửi job batch/streaming đến cụm Spark
Thay thế hoặc bổ trợ cho Notebook:
Notebook cho khám phá dữ liệu, tạo mẫu và cộng tác
Spark Job Definition để tự động hóa mã xử lý dữ liệu sẵn sàng sản xuất
Synapse Data Warehouse
Hoạt động như kho dữ liệu quan hệ truyền thống
Lưu dữ liệu trong OneLake với định dạng mở Delta Lake
Cho phép tương tác với các workload khác của Fabric
Không cần tạo nhiều bản sao dữ liệu
Chọn kho dữ liệu lưu trữ
Lakehouse
Dữ liệu phi cấu trúc (tệp)
Spark là giao diện phát triển chính
Warehouse
Dữ liệu có cấu trúc (bảng)
T-SQL là giao diện phát triển chính
Chọn công cụ sao chép dữ liệu
Chọn công cụ sao chép dữ liệu
Chọn công cụ sao chép dữ liệu
Ayo berlatih!
Biến đổi và Phân tích Dữ liệu với Microsoft Fabric
Preparing Video For Download...