Predikce a vyhodnocení

Úvod do Spark SQL v Pythonu

Mark Plutowski

Data Scientist

Aplikace modelu na testovací data

predicted = df_trained.transform(df_test)
  • sloupec predikcí: double
  • sloupec pravděpodobností: vektor délky dvě
x = predicted.first
print("Right!" if x.label == int(x.prediction) else "Wrong")
Úvod do Spark SQL v Pythonu

Vyhodnocení přesnosti klasifikace

model_stats = model.evaluate(df_eval)
type(model_stats)
pyspark.ml.classification.BinaryLogisticRegressionSummary)
print("\nPerformance: %.2f" % model_stats.areaUnderROC)
Úvod do Spark SQL v Pythonu

Příklad klasifikace textu

  • Pozitivní štítky:

    • ['her', 'him', 'he', 'she', 'them', 'us', 'they', 'himself', 'herself', 'we']
  • Počet příkladů: 5746

  • Počet příkladů: 2873 pozitivních, 2873 negativních
  • Počet trénovacích příkladů: 4607
  • Počet testovacích příkladů: 1139
  • Trénovací iterace: 21
  • Testovací AUC: 0,87
Úvod do Spark SQL v Pythonu

Predikce koncového slova

  • Pozitivní štítek: 'it'

  • Počet příkladů: 438

  • Počet příkladů: 219 pozitivních, 219 negativních
  • Počet trénovacích příkladů: 340
  • Počet testovacích příkladů: 98
  • Testovací AUC: 0,85
Úvod do Spark SQL v Pythonu

Pojďme si procvičit!

Úvod do Spark SQL v Pythonu

Preparing Video For Download...