Microsoft Fabric におけるデータエンジニアリング
Microsoft Fabricでデータを変換して分析する
Luis Silva
Solution Architect - Data & AI
エンドツーエンドのデータ分析
ソースから取り込み、データレイクに保存
データを準備・変換
データを可視化・分析
Data Factory
データの取り込み、準備、変換
Dataflow と Data Pipeline
Dataflow
低コードで取り込みと変換
Power Query 変換エンジン
Data Pipelines
タスクを実行するアクティビティの集合
アクティビティの種類:
データ移動(Copy アクティビティ、Dataflow)
データ変換(Notebook、Stored Procedure、Script)
制御(Switch、If、ForEach、Wait)
Synapse Data Engineering
Lakehouse
Notebook
Apache Spark ジョブ定義
Lakehouse
構造化データ(テーブル)
非構造化データ(ファイル)
Notebook
対話型の Web インターフェース
データ操作コード
データ可視化
コメント/説明
複数言語対応:
PySpark(Python)
Spark(Scala)
Spark SQL(SQL)
SparkR(R)
Apache Spark ジョブ定義
バッチ/ストリーミング ジョブを Spark クラスターに送信
Notebook の代替または補完:
Notebook は探索・試作・共同開発向け
Spark ジョブ定義は本番処理コードの自動化向け
Synapse Data Warehouse
従来のリレーショナル DWH のように動作
データは OneLake に Delta Lake 形式で保存
他の Fabric ワークロードと相互運用可能
データの複製作成は不要
データストアの選択
Lakehouse
非構造化データ(ファイル)
主な開発インターフェースは Spark
Warehouse
構造化データ(テーブル)
主な開発インターフェースは T-SQL
データコピー ツールの選択
データコピー ツールの選択
データコピー ツールの選択
Ayo berlatih!
Microsoft Fabricでデータを変換して分析する
Preparing Video For Download...