Feature Engineering mit PySpark
John Hogue
Lead Data Scientist, General Mills
VORTEILE

NACHTEILE

Unsere Datenausrichtung

DataFrame.join(other, # Anderer DataFrame zum Mergenon=None, # Schlüssel für den Joinhow=None) # Art des Joins (Standard: 'inner')
# Kopf des DataFrames prüfen
hdf.show(2)
+----------+--------------------+
| dt| nm|
+----------+--------------------+
|2012-01-02| New Year Day|
|2012-01-16|Martin Luther Kin...|
+----------+--------------------+
only showing top 2 rows
# Join-Bedingung festlegen cond = [df['OFFMARKETDATE'] == hdf['dt']]# hdf per Left-Join an df anfügen df = df.join(hdf, on=cond, 'left')# Wie viele Verkäufe fielen auf Bankfeiertage? df.where(~df['nm'].isNull()).count()
0
# DataFrames als temporäre Tabellen registrieren
df.createOrReplaceTempView("df")
hdf.createOrReplaceTempView("hdf")
# Eine SQL-Anweisung schreiben
sql_df = spark.sql("""
SELECT
*
FROM df
LEFT JOIN hdf
ON df.OFFMARKETDATE = hdf.dt
""")
Feature Engineering mit PySpark