Strojenie hiperparametrów w Pythonie
Alex Scriven
Data Scientist
Niektóre hiperparametry są ważniejsze do strojenia niż inne.
Ale jakie wartości wypróbować?
Przyjrzyjmy się najważniejszym wskazówkom!
Należy uważać na konflikty między hiperparametrami.
LogisticRegression() — konflikty między solver i penalty.The 'newton-cg', 'sag' and 'lbfgs' solvers support only l2 penalties.
Niektóre konflikty nie są jawne — parametr jest po prostu ignorowany (np. ElasticNet z normalize):
This parameter is ignored when fit_intercept is set to False
Zawsze sprawdzaj dokumentację Scikit-Learn!
Uważaj na ustawianie bezsensownych wartości hiperparametrów:
Dokumentowanie sensownych wartości hiperparametrów to cenne zadanie.
W poprzednim ćwiczeniu budowaliśmy modele w ten sposób:
knn_5 = KNeighborsClassifier(n_neighbors=5)
knn_10 = KNeighborsClassifier(n_neighbors=10)
knn_20 = KNeighborsClassifier(n_neighbors=20)
To mało efektywne. Czy da się to zrobić lepiej?
Użyj pętli for do iteracji po opcjach:
neighbors_list = [3,5,10,20,50,75]accuracy_list = []for test_number in neighbors_list: model = KNeighborsClassifier(n_neighbors=test_number) predictions = model.fit(X_train, y_train).predict(X_test)accuracy = accuracy_score(y_test, predictions) accuracy_list.append(accuracy)
Wyniki możemy przechować w DataFrame:
results_df = pd.DataFrame({'neighbors':neighbors_list, 'accuracy':accuracy_list})
print(results_df)

Stwórzmy wykres krzywej uczenia
Tym razem przetestujemy znacznie więcej wartości
neighbors_list = list(range(5,500, 5))accuracy_list = [] for test_number in neighbors_list: model = KNeighborsClassifier(n_neighbors=test_number) predictions = model.fit(X_train, y_train).predict(X_test) accuracy = accuracy_score(y_test, predictions) accuracy_list.append(accuracy) results_df = pd.DataFrame({'neighbors':neighbors_list, 'accuracy':accuracy_list})
Możemy zwizualizować większy DataFrame:
plt.plot(results_df['neighbors'], results_df['accuracy'])# Add the labels and title plt.gca().set(xlabel='n_neighbors', ylabel='Accuracy', title='Accuracy for different n_neighbors') plt.show()
Nasz wykres:

Funkcja range w Pythonie nie obsługuje kroków dziesiętnych.
Przydatna sztuczka to np.linspace(start, end, num) z NumPy
num równomiernie rozłożonych wartości w przedziale (start, end).print(np.linspace(1,2,5))
[1. 1.25 1.5 1.75 2. ]
Strojenie hiperparametrów w Pythonie