Прогнозування та оцінювання

Вступ до Spark SQL у Python

Mark Plutowski

Data Scientist

Застосування моделі до даних оцінювання

predicted = df_trained.transform(df_test)
  • стовпчик прогнозу: double
  • стовпчик імовірності: вектор довжини два
x = predicted.first
print("Right!" if x.label == int(x.prediction) else "Wrong")
Вступ до Spark SQL у Python

Оцінювання точності класифікації

model_stats = model.evaluate(df_eval)
type(model_stats)
pyspark.ml.classification.BinaryLogisticRegressionSummary)
print("\nPerformance: %.2f" % model_stats.areaUnderROC)
Вступ до Spark SQL у Python

Приклад класифікації тексту

  • Позитивні мітки:

    • ['her', 'him', 'he', 'she', 'them', 'us', 'they', 'himself', 'herself', 'we']
  • Кількість прикладів: 5746

  • Кількість прикладів: 2873 позитивні, 2873 негативні
  • Кількість тренувальних прикладів: 4607
  • Кількість тестових прикладів: 1139
  • кількість ітерацій навчання: 21
  • Тестовий AUC: 0.87
Вступ до Spark SQL у Python

Прогнозування кінцевого слова

  • Позитивна мітка: 'it'

  • Кількість прикладів: 438

  • Кількість прикладів: 219 позитивні, 219 негативні
  • Кількість тренувальних прикладів: 340
  • Кількість тестових прикладів: 98
  • Тестовий AUC: 0.85
Вступ до Spark SQL у Python

Давайте потренуємось!

Вступ до Spark SQL у Python

Preparing Video For Download...