Analiza końcowa i prezentacja wyników

Czyszczenie danych w PySpark

Mike Metzger

Data Engineering Consultant

Obliczenia analityczne (UDF)

Obliczenia z użyciem UDF

def getAvgSale(saleslist):
  totalsales = 0
  count = 0
  for sale in saleslist:
    totalsales += sale[2] + sale[3]
    count += 2
  return totalsales / count

udfGetAvgSale = udf(getAvgSale, DoubleType()) df = df.withColumn('avg_sale', udfGetAvgSale(df.sales_list))
Czyszczenie danych w PySpark

Obliczenia analityczne (inline)

Obliczenia inline

df = df.read.csv('datafile')

df = df.withColumn('avg', (df.total_sales / df.sales_count))
df = df.withColumn('sq_ft', df.width * df.length)
df = df.withColumn('total_avg_size', udfComputeTotal(df.entries) / df.numEntries)
Czyszczenie danych w PySpark

Czas na ćwiczenia!

Czyszczenie danych w PySpark

Preparing Video For Download...