Régression logistique : retour

Analyse de sentiment en Python

Violeta Misheva

Data Scientist

Modèles complexes et régularisation

Modèles complexes :

  • Modèle complexe qui capte le bruit des données (surapprentissage)
  • Grand nombre de caractéristiques ou de paramètres

Régularisation :

  • Façon de simplifier pour obtenir un modèle moins complexe
Analyse de sentiment en Python

Régularisation dans une régression logistique

from sklearn.linear_model import LogisticRegression
# Regularization arguments
LogisticRegression(penalty='l2', C=1.0)
  • L2 : rétrécit tous les coefficients vers zéro
  • C élevé : faible pénalisation, le modèle épouse bien les données d'entraînement.
  • C faible : forte pénalisation, modèle moins flexible.
Analyse de sentiment en Python

Prédire une probabilité vs une classe

log_reg = LogisticRegression().fit(X_train, y_train)
# Prédire les étiquettes
y_predicted = log_reg.predict(X_test)
# Prédire la probabilité
y_probab = log_reg.predict_proba(X_test)
Analyse de sentiment en Python

Prédire une probabilité vs une classe

y_probab
array([[0.5002245, 0.4997755],
       [0.4900345, 0.5099655],
        ...,
       [0.7040499, 0.2959501]])
# Sélectionner les probabilités de la classe 1
y_probab = log_reg.predict_proba(X_test)[:, 1]
array([0.4997755, 0.5099655 ..., 0.2959501]])
Analyse de sentiment en Python

Mesures du modèle avec des probabilités prédites

  • Provoque une ValueError lorsqu'appliquée à des probabilités.
  • L'exactitude et la matrice de confusion s'emploient avec des classes.
# Encodage de probabilité par défaut :
# Si probabilité >= 0.5, alors classe 1 sinon classe 0
Analyse de sentiment en Python

Passons à la pratique !

Analyse de sentiment en Python

Preparing Video For Download...