PySpark ile Özellik Mühendisliği
John Hogue
Lead Data Scientist, General Mills
Rastgele Orman Regresyonu

Ekonomik
Yönetsel
Sosyal
Mevsimsel
Zamansal Özellikler
Oranlar, Orantılar, Toplamlar
Genişletilmiş Özellikler
# Verimizin şekli nedir?
print((df.count(), len(df.columns)))
(5000, 126)
from pyspark.ml.feature import VectorAssembler
# Eksik değerleri değiştirin
df = df.fillna(-1)
# Vektöre dönüştürülecek sütunları tanımlayın
features_cols = list(df.columns)
# Bağımlı değişkeni listeden çıkarın
features_cols.remove('SALESCLOSEPRICE')
# Vektör birleştirici dönüştürücüyü oluşturun vec = VectorAssembler(inputCols=features_cols, outputCol='features')# Vektör dönüştürücüyü veriye uygulayın df = vec.transform(df)# Yalnızca özellik vektörlerini ve bağımlı değişkeni seçin ml_ready_df = df.select(['SALESCLOSEPRICE', 'features'])# Sonuçları inceleyin ml_ready_df.show(5)
+----------------+--------------------+
| SALESCLOSEPRICE| features|
+----------------+--------------------+
|143000 |(125,[0,1,2,3,5,6...|
|190000 |(125,[0,1,2,3,5,6...|
|225000 |(125,[0,1,2,3,5,6...|
|265000 |(125,[0,1,2,3,4,5...|
|249900 |(125,[0,1,2,3,4,5...|
+----------------+--------------------+
only showing top 5 rows
PySpark ile Özellik Mühendisliği