预测与评估

Python 中的 Spark SQL 入门

Mark Plutowski

Data Scientist

将模型应用于评估数据

predicted = df_trained.transform(df_test)
  • 预测列:double
  • 概率列:长度为 2 的向量
x = predicted.first
print("Right!" if x.label == int(x.prediction) else "Wrong")
Python 中的 Spark SQL 入门

评估分类准确性

model_stats = model.evaluate(df_eval)
type(model_stats)
pyspark.ml.classification.BinaryLogisticRegressionSummary)
print("\nPerformance: %.2f" % model_stats.areaUnderROC)
Python 中的 Spark SQL 入门

文本分类示例

  • 正类标签:

    • ['her', 'him', 'he', 'she', 'them', 'us', 'they', 'himself', 'herself', 'we']
  • 样本数:5746

  • 样本数:2873 正类2873 负类
  • 训练样本数:4607
  • 测试样本数:1139
  • 训练迭代:21
  • 测试 AUC:0.87
Python 中的 Spark SQL 入门

预测结尾词

  • 正类标签:'it'

  • 样本数:438

  • 样本数:219 正类219 负类
  • 训练样本数:340
  • 测试样本数:98
  • 测试 AUC:0.85
Python 中的 Spark SQL 入门

让我们来练习!

Python 中的 Spark SQL 入门

Preparing Video For Download...