Оптимизация производительности потока данных

Приём данных и семантические модели в Microsoft Fabric

Alex Kuntz

Head of Cloud Curriculum, DataCamp

Промежуточное хранение в Dataflows Gen2

Временно хранит данные в ходе преобразования для повышения производительности

  • Промежуточные артефакты:
    • Скрытое внутреннее хранилище Lakehouse, используемое при преобразовании данных
    • Управляется Dataflows автоматически; прямой доступ пользователей не предусмотрен
  • Когда использовать промежуточное хранение:
    • Включено по умолчанию для повышения производительности SQL-эндпоинта
    • Отключено при прямой загрузке в Lakehouse и не-складские хранилища (можно включить вручную)
  • Удаление промежуточных данных:
    • Отключите промежуточное хранение и обновите данные (очищаются через 30 дней)
    • Удалите поток данных или рабочую область для немедленного удаления
Приём данных и семантические модели в Microsoft Fabric

Ускорение приёма данных с помощью Fast Copy

Функция высокоскоростного приёма данных, которая эффективно масштабируется для работы с большими наборами данных

  • Архитектура: Перераспределяет нагрузку с Power Query на высокопроизводительный конвейер для ускоренной обработки
  • Преимущество: Сокращает время обработки за счёт масштабируемых серверных ресурсов для больших данных

Архитектура Fast Copy в DataFlows Gen2

Приём данных и семантические модели в Microsoft Fabric

Оптимизация Fast Copy: требования и ключевые настройки

Требования:

  • Файлы: от 100 МБ (CSV/Parquet)
  • Базы данных: от 5 млн строк (Azure SQL DB, PostgreSQL)
  • Поддерживаемые коннекторы: ADLS Gen2, Blob Storage, SQL DB, Lakehouse, PostgreSQL, локальный SQL Server, Warehouse, Oracle
  • Поддерживаемые преобразования: объединение файлов, выбор столбцов, изменение типов данных, переименование/удаление столбцов

Параметр «Требовать Fast Copy»:

  • Принудительно использует Fast Copy; немедленно завершается с ошибкой, если условия не выполнены
  • Экономит время, исключая долгое ожидание при медленной обработке
Приём данных и семантические модели в Microsoft Fabric

Назначение по умолчанию в Dataflow Gen2

  • Создавайте отдельные потоки данных для конкретных назначений (Lakehouse, Warehouse или KQL Database).

  • Предустановленные параметры назначения применяются автоматически — это ускоряет разработку!

Предустановленные параметры: значения по умолчанию, изменить нельзя

  • Lakehouse: метод обновления «Замена», динамическая схема
  • Warehouse/KQL Database: метод обновления «Добавление», фиксированная схема

Назначение данных по умолчанию в Dataflows Gen2

Приём данных и семантические модели в Microsoft Fabric

Давайте потренируемся!

Приём данных и семантические модели в Microsoft Fabric

Preparing Video For Download...