Przewidywanie i ewaluacja

Wprowadzenie do Spark SQL w Pythonie

Mark Plutowski

Data Scientist

Zastosowanie modelu do danych ewaluacyjnych

predicted = df_trained.transform(df_test)
  • kolumna przewidywań: double
  • kolumna prawdopodobieństwa: wektor długości dwa
x = predicted.first
print("Right!" if x.label == int(x.prediction) else "Wrong")
Wprowadzenie do Spark SQL w Pythonie

Ocena dokładności klasyfikacji

model_stats = model.evaluate(df_eval)
type(model_stats)
pyspark.ml.classification.BinaryLogisticRegressionSummary)
print("\nPerformance: %.2f" % model_stats.areaUnderROC)
Wprowadzenie do Spark SQL w Pythonie

Przykład klasyfikacji tekstu

  • Etykiety pozytywne:

    • ['her', 'him', 'he', 'she', 'them', 'us', 'they', 'himself', 'herself', 'we']
  • Liczba przykładów: 5746

  • Liczba przykładów: 2873 pozytywnych, 2873 negatywnych
  • Liczba przykładów treningowych: 4607
  • Liczba przykładów testowych: 1139
  • Iteracje treningowe: 21
  • AUC na zbiorze testowym: 0.87
Wprowadzenie do Spark SQL w Pythonie

Przewidywanie ostatniego słowa

  • Etykieta pozytywna: 'it'

  • Liczba przykładów: 438

  • Liczba przykładów: 219 pozytywnych, 219 negatywnych
  • Liczba przykładów treningowych: 340
  • Liczba przykładów testowych: 98
  • AUC na zbiorze testowym: 0.85
Wprowadzenie do Spark SQL w Pythonie

Czas na ćwiczenia!

Wprowadzenie do Spark SQL w Pythonie

Preparing Video For Download...