Логистическая регрессия: повторение

Анализ тональности текста на Python

Violeta Misheva

Data Scientist

Сложные модели и регуляризация

Сложные модели:

  • Сложная модель, улавливающая шум в данных (переобучение)
  • Большое количество признаков или параметров

Регуляризация:

  • Способ упростить модель и снизить её сложность
Анализ тональности текста на Python

Регуляризация в логистической регрессии

from sklearn.linear_model import LogisticRegression
# Regularization arguments
LogisticRegression(penalty='l2', C=1.0)
  • L2: уменьшает все коэффициенты в сторону нуля
  • Высокие значения C: слабая регуляризация, модель хорошо подстраивается под обучающие данные.
  • Низкие значения C: сильная регуляризация, модель менее гибкая.
Анализ тональности текста на Python

Прогнозирование вероятности и прогнозирование класса

log_reg = LogisticRegression().fit(X_train, y_train)
# Predict labels 
y_predicted = log_reg.predict(X_test)
# Predict probability
y_probab = log_reg.predict_proba(X_test)
Анализ тональности текста на Python

Прогнозирование вероятности и прогнозирование класса

y_probab
array([[0.5002245, 0.4997755],
       [0.4900345, 0.5099655],
        ...,
       [0.7040499, 0.2959501]])
# Select the probabilities of class 1
y_probab = log_reg.predict_proba(X_test)[:, 1]
array([0.4997755, 0.5099655 ..., 0.2959501]])
Анализ тональности текста на Python

Метрики модели при прогнозировании вероятностей

  • Вызывает ValueError при использовании с вероятностями.
  • Точность и матрица ошибок работают с классами.
# Default probability encoding:
# If probability >= 0.5, then class 1 Else class 0
Анализ тональности текста на Python

Давайте потренируемся!

Анализ тональности текста на Python

Preparing Video For Download...