Вступ до конвеєрів даних

Очищення даних у PySpark

Mike Metzger

Data Engineering Consultant

Що таке конвеєр даних?

  • Набір кроків для обробки даних від джерел до фінального результату
  • Може містити будь-яку кількість кроків або компонентів
  • Може охоплювати багато систем
  • Ми зосередимось на конвеєрах даних у Spark
Очищення даних у PySpark

Як виглядає конвеєр даних?

  • Вхідні дані
    • CSV, JSON, вебсервіси, бази даних
  • Перетворення
    • withColumn(), .filter(), .drop()
  • Вивід
    • CSV, Parquet, база даних
  • Валідація
  • Аналіз
Очищення даних у PySpark

Подробиці конвеєра

  • Формально не визначений у Spark
  • Зазвичай це звичайний код Spark, потрібний для задачі
    schema = StructType([
    StructField('name', StringType(), False),
    StructField('age', StringType(), False)
    ])
    df = spark.read.format('csv').load('datafile').schema(schema)
    df = df.withColumn('id', monotonically_increasing_id())
    ...
    df.write.parquet('outdata.parquet')
    df.write.json('outdata.json')
    
Очищення даних у PySpark

Давайте потренуємось!

Очищення даних у PySpark

Preparing Video For Download...