फीचर्स को स्टैंडर्डाइज़ करना

Python में Machine Learning के साथ CTR प्रेडिक्शन

Kevin Huo

Instructor

स्टैंडर्डाइज़ेशन क्यों ज़रूरी है

  • स्टैंडर्डाइज़ेशन: सुनिश्चित करना कि आपका डेटा मॉडलों की मान्यताओं में फिट हो
  • कुछ फीचर्स का variance बहुत अधिक हो सकता है, जो मॉडलों पर हावी हो जाता है
  • उदाहरण: किसी एक spam उपयोगकर्ता के कारण कुछ count का रेंज बहुत बड़ा हो सकता है
  • site_id, app_id, device_id जैसे categorical variables पर लागू नहीं होता
Python में Machine Learning के साथ CTR प्रेडिक्शन

Log normalization

df.var()
click                   1.294270e-01
hour                    1.123316e-01
df.var().median()
0.7108583771671939
print(df['click'].var())
df['device_id_count'] = df[
  'device_id_count'].apply(
  lambda x: np.log(x))
print(df['click'].var())
249362570.10134825
15.628476003312514
Python में Machine Learning के साथ CTR प्रेडिक्शन

डेटा को स्केल करना

  • स्टैंडर्ड स्केलिंग सभी फीचर्स का mean 0 और standard deviation 1 कर देती है

स्टैंडर्ड स्केलिंग का उदाहरण

  • आम तौर पर Machine Learning मॉडलों के लिए अच्छा अभ्यास है
Python में Machine Learning के साथ CTR प्रेडिक्शन

डेटा को स्टैंडर्ड स्केल कैसे करें

  • स्केलिंग StandardScaler() से ऐसे करें:
scaler = StandardScaler()
X[numeric_cols] = scaler.fit_transform(X[numeric_cols])
dtype: float64
1    10.5 -> 0.85
2    32.3 -> 1.54
Python में Machine Learning के साथ CTR प्रेडिक्शन

अभ्यास करते हैं!

Python में Machine Learning के साथ CTR प्रेडिक्शन

Preparing Video For Download...