動的タスクマッピング

Airflow によるデータパイプラインの構築

Volker Janz

Senior Developer Advocate at Astronomer

ハードコードされたタスクの問題

@task
def process_file_1():
    transform("/data/file_1.csv")
@task
def process_file_2():
    transform("/data/file_2.csv")
@task
def process_file_3():
    transform("/data/file_3.csv")

動的タスクマッピングの例

Airflow によるデータパイプラインの構築

.expand()

@task
def fetch_files():
    return ["/data/file_1.csv", "/data/file_2.csv", "/data/file_3.csv"]

@task(max_active_tis_per_dagrun=2) # control max parallelism def process_file(path: str): print(f"processing file: {path}")
files = fetch_files() process_file.expand(path=files)

実行時のスケール

Airflow によるデータパイプラインの構築

UIでのマップされたタスク

 

  • マップされたインスタンスは、単一タスク配下にインデックス付きインスタンスとして表示されます
  • 各インスタンスをクリックすると個別のログとステータスを確認できます
  • 数百のインスタンスがあってもDAGは読みやすいまま保たれます

UIでのマップされたタスク

Airflow によるデータパイプラインの構築

.partial()

@task
def process_file(path: str, output_dir: str):
    transform(path, output_dir)

files = get_files() process_file.partial(output_dir="/out").expand(path=files)

partialとexpand

Airflow によるデータパイプラインの構築

直積問題

files = get_files()           # ["/data/a.csv", "/data/b.csv", "/data/c.csv"]
destinations = get_targets()  # ["s3://out/a", "s3://out/b", "s3://out/c"]

# Cross product: 3 x 3 = 9 instances (not what we want!) process.expand(path=files, dest=destinations)

リストのzip

Airflow によるデータパイプラインの構築

.zip()

files = get_files()           # ["/data/a.csv", "/data/b.csv", "/data/c.csv"]
destinations = get_targets()  # ["s3://out/a", "s3://out/b", "s3://out/c"]

# Paired: 3 instances (a->a, b->b, c->c) process.expand_kwargs(files.zip(destinations))

 

  • zip() は位置で項目を1対1に対応付けます
  • expand_kwargs は各ペアをキーワード引数として展開します
Airflow によるデータパイプラインの構築

使い分けの指針

 

パターン 用途
expand() 単一リストへのマッピング
partial() インスタンス間で共通パラメータを固定
zip() 複数リストを位置でペアリング

 

  • スケーラブルなDAGの構築に役立ちます
  • データが変わると、タスク数が実行時に自動で調整されます
Airflow によるデータパイプラインの構築

練習しましょう!

Airflow によるデータパイプラインの構築

Preparing Video For Download...