Wprowadzenie do potoków danych

Czyszczenie danych w PySpark

Mike Metzger

Data Engineering Consultant

Czym jest potok danych?

  • Zestaw kroków przetwarzających dane ze źródeł do wyników
  • Może składać się z dowolnej liczby kroków lub komponentów
  • Może obejmować wiele systemów
  • Skupimy się na potokach danych w Sparku
Czyszczenie danych w PySpark

Jak wygląda potok danych?

  • Dane wejściowe
    • CSV, JSON, usługi sieciowe, bazy danych
  • Transformacje
    • withColumn(), .filter(), .drop()
  • Dane wyjściowe
    • CSV, Parquet, baza danych
  • Walidacja
  • Analiza
Czyszczenie danych w PySpark

Szczegóły potoku

  • Nie jest formalnie zdefiniowany w Sparku
  • Zazwyczaj cały kod Spark wymagany do zadania
    schema = StructType([
    StructField('name', StringType(), False),
    StructField('age', StringType(), False)
    ])
    df = spark.read.format('csv').load('datafile').schema(schema)
    df = df.withColumn('id', monotonically_increasing_id())
    ...
    df.write.parquet('outdata.parquet')
    df.write.json('outdata.json')
    
Czyszczenie danych w PySpark

Czas na ćwiczenia!

Czyszczenie danych w PySpark

Preparing Video For Download...