Prediktera och utvärdera

Introduktion till Spark SQL i Python

Mark Plutowski

Data Scientist

Tillämpa en modell på testdata

predicted = df_trained.transform(df_test)
  • prediktionskolumn: double
  • sannolikhetskolumn: vektor med längd två
x = predicted.first
print("Right!" if x.label == int(x.prediction) else "Wrong")
Introduktion till Spark SQL i Python

Utvärdera klassificeringsnoggrannhet

model_stats = model.evaluate(df_eval)
type(model_stats)
pyspark.ml.classification.BinaryLogisticRegressionSummary)
print("\nPerformance: %.2f" % model_stats.areaUnderROC)
Introduktion till Spark SQL i Python

Exempel på textklassificering

  • Positiva etiketter:

    • ['her', 'him', 'he', 'she', 'them', 'us', 'they', 'himself', 'herself', 'we']
  • Antal exempel: 5 746

  • Antal exempel: 2 873 positiva, 2 873 negativa
  • Antal träningsexempel: 4 607
  • Antal testexempel: 1 139
  • Träningsiterationer: 21
  • Test-AUC: 0,87
Introduktion till Spark SQL i Python

Prediktera slutordet

  • Positiv etikett: 'it'

  • Antal exempel: 438

  • Antal exempel: 219 positiva, 219 negativa
  • Antal träningsexempel: 340
  • Antal testexempel: 98
  • Test-AUC: 0,85
Introduktion till Spark SQL i Python

Nu kör vi en övning!

Introduktion till Spark SQL i Python

Preparing Video For Download...