Prédire et évaluer

Introduction à Spark SQL en Python

Mark Plutowski

Data Scientist

Appliquer un modèle aux données d'évaluation

predicted = df_trained.transform(df_test)
  • colonne des prédictions : double
  • colonne des probabilités : vecteur de longueur deux
x = predicted.first
print("Right!" if x.label == int(x.prediction) else "Wrong")
Introduction à Spark SQL en Python

Évaluer la justesse de la classification

model_stats = model.evaluate(df_eval)
type(model_stats)
pyspark.ml.classification.BinaryLogisticRegressionSummary)
print("\nPerformance: %.2f" % model_stats.areaUnderROC)
Introduction à Spark SQL en Python

Exemple de classification de texte

  • Étiquettes positives :

    • ['her', 'him', 'he', 'she', 'them', 'us', 'they', 'himself', 'herself', 'we']
  • Nombre d'exemples : 5746

  • Nombre d'exemples : 2873 positifs, 2873 négatifs
  • Nombre d'exemples d'entraînement : 4607
  • Nombre d'exemples de test : 1139
  • itérations d'entraînement : 21
  • AUC en test : 0,87
Introduction à Spark SQL en Python

Prédire le mot final

  • Étiquette positive : 'it'

  • Nombre d'exemples : 438

  • Nombre d'exemples : 219 positifs, 219 négatifs
  • Nombre d'exemples d'entraînement : 340
  • Nombre d'exemples de test : 98
  • AUC en test : 0,85
Introduction à Spark SQL en Python

Passons à la pratique !

Introduction à Spark SQL en Python

Preparing Video For Download...