最終分析と納品

PySpark でデータをクレンジングする

Mike Metzger

Data Engineering Consultant

分析計算(UDF)

UDF を用いた計算

def getAvgSale(saleslist):
  totalsales = 0
  count = 0
  for sale in saleslist:
    totalsales += sale[2] + sale[3]
    count += 2
  return totalsales / count

udfGetAvgSale = udf(getAvgSale, DoubleType()) df = df.withColumn('avg_sale', udfGetAvgSale(df.sales_list))
PySpark でデータをクレンジングする

分析計算(インライン)

インライン計算

df = df.read.csv('datafile')

df = df.withColumn('avg', (df.total_sales / df.sales_count))
df = df.withColumn('sq_ft', df.width * df.length)
df = df.withColumn('total_avg_size', udfComputeTotal(df.entries) / df.numEntries)
PySpark でデータをクレンジングする

演習に進みましょう!

PySpark でデータをクレンジングする

Preparing Video For Download...