Daha Fazla Veri Alma

PySpark ile Özellik Mühendisliği

John Hogue

Lead Data Scientist, General Mills

Harici Veri Kümeleri Üzerine Düşünceler

ARTILAR

  • Önemli değişkenler ekler
  • Değerleri tamamlar/değiştirir
  • Ucuz veya kolay elde edilir

Veri Birleştirme

EKSİLER

  • Analizi yavaşlatabilir
  • Veri sızıntısı yaratmak kolaydır
  • Veri kümesi konusunda uzman olmanız gerekir

Sorumluluk

PySpark ile Özellik Mühendisliği

Join’lar Hakkında

Veri yönlerimizi belirleme

  • Sol: başlangıç veri kümesi
  • Sağ: eklenecek yeni veri kümesi

SQL Birleştirmeleri

PySpark ile Özellik Mühendisliği

PySpark DataFrame Join’ları

DataFrame.join(

other, # Birleştirilecek diğer DataFrame
on=None, # Join anahtarları
how=None) # Join türü (varsayılan: 'inner')
PySpark ile Özellik Mühendisliği

PySpark Join Örneği

# Inspect dataframe head
hdf.show(2)
+----------+--------------------+
|        dt|                  nm|
+----------+--------------------+
|2012-01-02|        New Year Day|
|2012-01-16|Martin Luther Kin...|
+----------+--------------------+
only showing top 2 rows
# Specify join conditon
cond = [df['OFFMARKETDATE'] == hdf['dt']]

# Join two hdf onto df df = df.join(hdf, on=cond, 'left')
# How many sales occurred on bank holidays? df.where(~df['nm'].isNull()).count()
0
PySpark ile Özellik Mühendisliği

SparkSQL Join

  • SQL’i veri çerçevenize uygulayın
# Register the dataframe as a temp table
df.createOrReplaceTempView("df")
hdf.createOrReplaceTempView("hdf")
# Write a SQL Statement
sql_df = spark.sql("""
                      SELECT 
                        *
                      FROM df
                      LEFT JOIN hdf
                      ON df.OFFMARKETDATE = hdf.dt
                   """)
PySpark ile Özellik Mühendisliği

Biraz Veri Birleştirelim!

PySpark ile Özellik Mühendisliği

Preparing Video For Download...