Предсказание и оценка

Введение в Spark SQL на Python

Mark Plutowski

Data Scientist

Применение модели к тестовым данным

predicted = df_trained.transform(df_test)
  • столбец предсказаний: double
  • столбец вероятностей: вектор длины два
x = predicted.first
print("Right!" if x.label == int(x.prediction) else "Wrong")
Введение в Spark SQL на Python

Оценка точности классификации

model_stats = model.evaluate(df_eval)
type(model_stats)
pyspark.ml.classification.BinaryLogisticRegressionSummary)
print("\nPerformance: %.2f" % model_stats.areaUnderROC)
Введение в Spark SQL на Python

Пример классификации текста

  • Положительные метки:

    • ['her', 'him', 'he', 'she', 'them', 'us', 'they', 'himself', 'herself', 'we']
  • Количество примеров: 5746

  • Количество примеров: 2873 положительных, 2873 отрицательных
  • Количество обучающих примеров: 4607
  • Количество тестовых примеров: 1139
  • Итераций обучения: 21
  • AUC на тесте: 0.87
Введение в Spark SQL на Python

Предсказание последнего слова

  • Положительная метка: 'it'

  • Количество примеров: 438

  • Количество примеров: 219 положительных, 219 отрицательных
  • Количество обучающих примеров: 340
  • Количество тестовых примеров: 98
  • AUC на тесте: 0.85
Введение в Spark SQL на Python

Давайте потренируемся!

Введение в Spark SQL на Python

Preparing Video For Download...