데이터플로우 성능 최적화

Microsoft Fabric로 데이터 수집과 Semantic Model 다루기

Alex Kuntz

Head of Cloud Curriculum, DataCamp

Dataflows Gen2의 스테이징

변환 중 데이터를 임시로 보관하여 성능을 최적화합니다

  • 스테이징 아티팩트:
    • 변환 시 사용하는 숨겨진 내부 Lakehouse 저장소
    • Dataflows가 자동 관리; 사용자 직접 접근 불가
  • 스테이징 사용 시점:
    • SQL 엔드포인트 성능 향상을 위해 기본 사용
    • Lakehouse 직접 로드 및 비-웨어하우스 로드는 기본 비활성(재활성화 가능)
  • 스테이징 데이터 제거:
    • 스테이징 비활성화 후 새로 고침(30일 후 자동 삭제)
    • 즉시 제거하려면 데이터플로우 또는 작업영역 삭제
Microsoft Fabric로 데이터 수집과 Semantic Model 다루기

Fast Copy로 수집 가속화

대용량 데이터를 효율적으로 처리하는 고속 수집 기능

  • 아키텍처: 무거운 작업을 Power Query에서 고성능 파이프라인으로 분산해 처리 속도 향상
  • 이점: 대규모 데이터에 대해 확장 가능한 백엔드를 활용해 처리 시간 단축

DataFlows Gen2 Fast Copy Architecture

Microsoft Fabric로 데이터 수집과 Semantic Model 다루기

Fast Copy 최적화: 조건 및 핵심 설정

사전 요구 사항:

  • 파일: 100MB+ (CSV/Parquet)
  • 데이터베이스: 500만+ 행 (Azure SQL DB, PostgreSQL)
  • 지원 커넥터: ADLS Gen2, Blob Storage, SQL DB, Lakehouse, PostgreSQL, 온프레미스 SQL Server, Warehouse, Oracle
  • 지원 변환: 파일 결합, 열 선택, 데이터 형식 변경, 열 이름 변경/제거

Fast Copy 필수 옵션:

  • Fast Copy 강제 사용, 기준 미충족 시 즉시 실패
  • 느린 처리로 인한 대기 시간을 피하여 시간 절약
Microsoft Fabric로 데이터 수집과 Semantic Model 다루기

Dataflow Gen2 기본 대상

  • 특정 대상(Lakehouse, Warehouse, 또는 KQL Database)별 단일 데이터플로우를 만듭니다.

  • 사전 설정된 대상 옵션이 자동 적용되어 개발이 빨라집니다!

기본 동작: 다음은 변경 불가한 기본값입니다

  • Lakehouse: 교체 업데이트 방식, 동적 스키마
  • Warehouse/KQL Database: 추가 업데이트 방식, 고정 스키마

Dataflows Gen2의 기본 데이터 대상

Microsoft Fabric로 데이터 수집과 Semantic Model 다루기

연습해 봅시다!

Microsoft Fabric로 데이터 수집과 Semantic Model 다루기

Preparing Video For Download...