Логістична регресія: повторення

Аналіз тональності в Python

Violeta Misheva

Data Scientist

Складні моделі та регуляризація

Складні моделі:

  • Складна модель, що підлаштовується під шум у даних (перенавчання)
  • Велика кількість ознак або параметрів

Регуляризація:

  • Спосіб спростити модель і зменшити її складність
Аналіз тональності в Python

Регуляризація в логістичній регресії

from sklearn.linear_model import LogisticRegression
# Параметри регуляризації
LogisticRegression(penalty='l2', C=1.0)
  • L2: зменшує всі коефіцієнти до нуля
  • Високі значення C: слабке штрафування, модель добре підганяється під тренувальні дані.
  • Низькі значення C: сильне штрафування, модель менш гнучка.
Аналіз тональності в Python

Прогноз імовірності vs. прогноз класу

log_reg = LogisticRegression().fit(X_train, y_train)
# Прогноз міток 
y_predicted = log_reg.predict(X_test)
# Прогноз імовірностей
y_probab = log_reg.predict_proba(X_test)
Аналіз тональності в Python

Прогноз імовірності vs. прогноз класу

y_probab
array([[0.5002245, 0.4997755],
       [0.4900345, 0.5099655],
        ...,
       [0.7040499, 0.2959501]])
# Виберіть імовірності класу 1
y_probab = log_reg.predict_proba(X_test)[:, 1]
array([0.4997755, 0.5099655 ..., 0.2959501]])
Аналіз тональності в Python

Метрики моделі для передбачених імовірностей

  • Викликає ValueError, якщо застосувати до ймовірностей.
  • Точність і матриця похибок працюють із класами.
# Типове кодування ймовірності:
# Якщо ймовірність >= 0.5, тоді клас 1, інакше клас 0
Аналіз тональності в Python

Давайте потренуємось!

Аналіз тональності в Python

Preparing Video For Download...