Die TaskFlow-API

Data-Pipelines mit Airflow aufbauen

Volker Janz

Senior Developer Advocate at Astronomer

Der klassische Ansatz

def extract_data():
    return {"users": 150, "events": 4200}

with DAG("etl_pipeline") as dag: t1 = PythonOperator(task_id="extract", python_callable=extract_data) t2 = PythonOperator(task_id="summary", python_callable=print_summary)
t1 >> t2
Data-Pipelines mit Airflow aufbauen

Der TaskFlow-Ansatz

from airflow.sdk import dag, task

@dag def etl_pipeline(): @task def extract_data(): return {"users": 150}
data = extract_data() print_summary(data)
Data-Pipelines mit Airflow aufbauen

Warum TaskFlow?

 

  • Weniger Boilerplate, Decorators ersetzen Operator-Instanzen
  • Implizite Abhängigkeiten, Rückgabewerte verdrahten Tasks automatisch
  • Gut lesbar, Dag liest sich wie ein Python-Skript
  • Klassische Operatoren weiter für Provider-Integrationen verfügbar

TaskFlow API - visual

Data-Pipelines mit Airflow aufbauen

Airflow-UI: Grid-Ansicht

Airflow Grid view

 

  • Jede Spalte ist ein Dag-Run
  • Jede Zeile ist ein Task
  • Farben zeigen Status: grün = Erfolg, rot = fehlgeschlagen
  • Klicke auf ein Feld, um Logs und Details zu sehen
Data-Pipelines mit Airflow aufbauen

Airflow-UI: Graph-Ansicht

Airflow Grid view

 

  • Fokussiert einen einzelnen Dag-Run
  • Zeigt Abhängigkeiten und Parallelität
  • Details in den Einstellungen anpassen
Data-Pipelines mit Airflow aufbauen

Airflow-UI: Dag-Versionierung

Dag version indicator in Airflow UI

 

  • Verfolgt Strukturänderungen automatisch
  • Jeder Run ist mit der damals aktiven Version verknüpft
  • Versionen findest du im Panel Dag-Details
Data-Pipelines mit Airflow aufbauen

Lass uns üben!

Data-Pipelines mit Airflow aufbauen

Preparing Video For Download...