PySpark ile Özellik Mühendisliği
John Hogue
Lead Data Scientist, General Mills
import pandas as pd
# Özellik önemlerini pandas sütununa dönüştür
fi_df = pd.DataFrame(model.featureImportances.toArray(),
columns=['importance'])
# Özellik adları listesini pandas sütununa dönüştür
fi_df['feature'] = pd.Series(feature_cols)
# Veriyi özellik önemine göre sırala
fi_df.sort_values(by=['importance'], ascending=False, inplace=True)
# Sonuçları yorumla
model_df.head(9)
| feature |importance|
|-------------------------|----------|
| LISTPRICE | 0.312101 |
| ORIGINALLISTPRICE | 0.202142 |
| LIVINGAREA | 0.124239 |
| SQFT_TOTAL | 0.081260 |
| LISTING_TO_MEDIAN_RATIO | 0.075086 |
| TAXES | 0.048452 |
| SQFTABOVEGROUND | 0.045859 |
| BATHSTOTAL | 0.034397 |
| LISTING_PRICE_PER_SQFT | 0.018253 |
# Modeli kaydet
model.save('rfr_real_estate_model')
from pyspark.ml.regression import RandomForestRegressionModel
# Modeli yükle
model2 = RandomForestRegressionModel.load('rfr_real_estate_model')
PySpark ile Özellik Mühendisliği