Pengantar Data Pipeline

Membersihkan Data dengan PySpark

Mike Metzger

Data Engineering Consultant

Apa itu data pipeline?

  • Serangkaian langkah untuk memproses data dari sumber ke keluaran akhir
  • Dapat berisi sejumlah langkah atau komponen
  • Dapat melintas banyak sistem
  • Kita akan fokus pada data pipeline di Spark
Membersihkan Data dengan PySpark

Seperti apa bentuk data pipeline?

  • Input
    • CSV, JSON, layanan web, basis data
  • Transformasi
    • withColumn(), .filter(), .drop()
  • Output
    • CSV, Parquet, basis data
  • Validasi
  • Analisis
Membersihkan Data dengan PySpark

Rincian pipeline

  • Tidak didefinisikan secara formal di Spark
  • Umumnya berisi semua kode Spark normal yang dibutuhkan untuk tugas
    schema = StructType([
    StructField('name', StringType(), False),
    StructField('age', StringType(), False)
    ])
    df = spark.read.format('csv').load('datafile').schema(schema)
    df = df.withColumn('id', monotonically_increasing_id())
    ...
    df.write.parquet('outdata.parquet')
    df.write.json('outdata.json')
    
Membersihkan Data dengan PySpark

Ayo berlatih!

Membersihkan Data dengan PySpark

Preparing Video For Download...