优化 Dataflow 性能

使用 Microsoft Fabric 进行数据摄取与语义模型

Alex Kuntz

Head of Cloud Curriculum, DataCamp

Dataflows Gen2 的暂存

在转换期间临时保存数据以优化性能

  • 暂存工件:
    • 转换时使用的隐藏 Lakehouse 内部存储
    • 由 Dataflows 自动管理;不供用户直接访问
  • 何时使用暂存:
    • 默认启用,以提升 SQL 端点性能
    • 直写 Lakehouse 和非仓库加载时禁用(可重新启用)
  • 移除暂存数据:
    • 禁用暂存并刷新(30 天后自动清理)
    • 立即移除:删除 dataflow 或工作区
使用 Microsoft Fabric 进行数据摄取与语义模型

使用 Fast Copy 加速摄取

一种高速数据摄取功能,可高效扩展以处理大型数据集

  • 架构: 将繁重工作负载从 Power Query 重新分配到高性能管道,加速处理
  • 优势: 利用可扩展的后端资源,最小化大数据处理时间

DataFlows Gen2 快速复制架构

使用 Microsoft Fabric 进行数据摄取与语义模型

优化 Fast Copy:前提与关键设置

前提条件:

  • 文件:≥100 MB(CSV/Parquet)
  • 数据库:≥500 万行(Azure SQL DB、PostgreSQL)
  • 支持的连接器:ADLS Gen2、Blob Storage、SQL DB、Lakehouse、PostgreSQL、本地 SQL Server、Warehouse、Oracle
  • 支持的转换:合并文件、选择列、更改数据类型、重命名/删除列

"必须使用 Fast Copy"选项:

  • 强制使用 Fast Copy;不满足条件时立即失败
  • 避免慢速处理的长等待,节省时间
使用 Microsoft Fabric 进行数据摄取与语义模型

Dataflow Gen2 默认目标

  • 为特定目标(Lakehouse、Warehouse 或 KQL Database)创建独立 Dataflow。

  • 预设的数据目标设置将自动应用,加速开发!

预设行为:以下为默认且不可更改

  • Lakehouse: 替换更新方式,动态架构
  • Warehouse/KQL Database: 追加更新方式,固定架构

Dataflows Gen2 的默认数据目标

使用 Microsoft Fabric 进行数据摄取与语义模型

Passons à la pratique !

使用 Microsoft Fabric 进行数据摄取与语义模型

Preparing Video For Download...