Microsoft Fabric의 데이터 엔지니어링
Microsoft Fabric로 데이터 변환 및 분석
Luis Silva
Solution Architect - Data & AI
엔드 투 엔드 데이터 분석
소스에서 데이터를 수집해 데이터 레이크에 저장
데이터를 준비하고 변환
데이터를 시각화하고 분석
Data Factory
데이터 수집, 준비, 변환
Dataflow와 Data Pipeline
Dataflow
데이터 수집·변환을 위한 로우코드 인터페이스
Power Query 변환 엔진
Data Pipelines
작업을 수행하는 활동 모음
활동 유형:
데이터 이동(Copy 활동, Dataflow)
데이터 변환(Notebook, Stored Procedure, Script)
제어(Switch, If, ForEach, Wait)
Synapse Data Engineering
Lakehouse
Notebook
Apache Spark Job 정의
Lakehouse
구조화 데이터(테이블)
비구조화 데이터(파일)
Notebook
대화형 웹 인터페이스
데이터 조작 코드
데이터 시각화
주석/설명
다중 언어 지원:
PySpark(Python)
Spark(Scala)
Spark SQL(SQL)
SparkR(R)
Apache Spark Job Definition
Spark 클러스터에 배치/스트리밍 작업 제출
Notebook의 대안 또는 보완:
탐색, 프로토타이핑, 협업 개발에는 Notebook
운영 자동화에는 Spark Job Definition으로 제품 수준 코드 실행
Synapse Data Warehouse
전통적 관계형 데이터 웨어하우스처럼 동작
OneLake에 Delta Lake 오픈 포맷으로 저장
다른 Fabric 워크로드와 상호 운용 가능
데이터 복사본을 여러 개 만들 필요 없음
데이터 저장소 선택
Lakehouse
비구조화 데이터(파일)
기본 개발 인터페이스: Spark
Warehouse
구조화 데이터(테이블)
기본 개발 인터페이스: T-SQL
데이터 복사 도구 선택
데이터 복사 도구 선택
데이터 복사 도구 선택
연습해 봅시다!
Microsoft Fabric로 데이터 변환 및 분석
Preparing Video For Download...