Випадковий пошук у Scikit Learn

Тюнінг гіперпараметрів у Python

Alex Scriven

Data Scientist

Порівняння з GridSearchCV

 

Не потрібно вигадувати велосипед. Згадаємо кроки для Grid Search:

  1. Вибрати алгоритм/оцінювач
  2. Визначити, які гіперпараметри ми налаштовуємо
  3. Задати діапазон значень для кожного гіперпараметра
  4. Налаштувати схему перехресної перевірки; і
  5. Визначити функцію оцінки
  6. Додати корисну додаткову інформацію чи функції
Тюнінг гіперпараметрів у Python

Порівняння з Grid Search

   

Є лише одна відмінність:

  • Крок 7 = Вирішити, скільки вибірок взяти (потім вибіркувати)

 

Ось і все! (майже)

Тюнінг гіперпараметрів у Python

Порівняння модулів Scikit Learn

Модулі також подібні:

GridSearchCV:

sklearn.model_selection.GridSearchCV(estimator, param_grid, 
        scoring=None, fit_params=None, 
        n_jobs=None,
        refit=True, cv='warn', verbose=0, 
        pre_dispatch='2*n_jobs', 
        error_score='raise-deprecating',
        return_train_score='warn')

 

RandomizedSearchCV:

sklearn.model_selection.RandomizedSearchCV(estimator, 
        param_distributions, n_iter=10, 
        scoring=None, fit_params=None, 
        n_jobs=None, refit=True, 
        cv='warn', verbose=0, 
        pre_dispatch='2*n_jobs',
        random_state=None, 
        error_score='raise-deprecating', 
        return_train_score='warn')
Тюнінг гіперпараметрів у Python

Ключові відмінності

 

Дві ключові відмінності:

  • n_iter — кількість вибірок, які випадковий пошук бере з вашої сітки. У попередньому прикладі ви взяли 300.

  • param_distributions трохи відрізняється від param_grid, дозволяючи за потреби задати розподіл для вибірки.

    • Типово всі комбінації мають однаковий шанс бути обраними.
Тюнінг гіперпараметрів у Python

Створення об'єкта RandomizedSearchCV

Тепер можемо зібрати об'єкт випадкового пошуку так само, як grid search, але з нашою малою зміною:

# Set up the sample space
learn_rate_list = np.linspace(0.001,2,150)
min_samples_leaf_list = list(range(1,51))

# Create the grid
parameter_grid = {
    'learning_rate' : learn_rate_list,
    'min_samples_leaf' : min_samples_leaf_list}

# Define how many samples number_models = 10
Тюнінг гіперпараметрів у Python

Створення об'єкта RandomizedSearchCV

Тепер можемо побудувати об'єкт

# Create a random search object
random_GBM_class = RandomizedSearchCV(
    estimator = GradientBoostingClassifier(),
    param_distributions = parameter_grid,
    n_iter = number_models,
    scoring='accuracy',
    n_jobs=4, 
    cv = 10,
    refit=True, 
    return_train_score = True)
# Fit the object to our data
random_GBM_class.fit(X_train, y_train)
Тюнінг гіперпараметрів у Python

Аналіз результату

Виведення ідентичне!

Як подивитися, які значення гіперпараметрів обрано?

Словник cv_results_ (у відповідних стовпцях param_)!

Отримайте списки:

rand_x = list(random_GBM_class.cv_results_['param_learning_rate'])
rand_y = list(random_GBM_class.cv_results_['param_min_samples_leaf'])
Тюнінг гіперпараметрів у Python

Аналіз результату

Побудуємо візуалізацію:

# Make sure we set the limits of Y and X appriately
x_lims = [np.min(learn_rate_list), np.max(learn_rate_list)]
y_lims = [np.min(min_samples_leaf_list), np.max(min_samples_leaf_list)]

# Plot grid results plt.scatter(rand_y, rand_x, c=['blue']*10) plt.gca().set(xlabel='learn_rate', ylabel='min_samples_leaf', title='Random Search Hyperparameters') plt.show()
Тюнінг гіперпараметрів у Python

Аналіз результату

Подібний графік, як раніше:

випадкове покриття графіка

Тюнінг гіперпараметрів у Python

Давайте потренуємось!

Тюнінг гіперпараметрів у Python

Preparing Video For Download...