予測と評価

Pythonで学ぶ Spark SQL 入門

Mark Plutowski

Data Scientist

評価データへのモデル適用

predicted = df_trained.transform(df_test)
  • prediction 列: double
  • probability 列: 長さ2のベクトル
x = predicted.first
print("Right!" if x.label == int(x.prediction) else "Wrong")
Pythonで学ぶ Spark SQL 入門

分類精度の評価

model_stats = model.evaluate(df_eval)
type(model_stats)
pyspark.ml.classification.BinaryLogisticRegressionSummary)
print("\nPerformance: %.2f" % model_stats.areaUnderROC)
Pythonで学ぶ Spark SQL 入門

テキスト分類の例

  • ポジティブラベル:

    • ['her', 'him', 'he', 'she', 'them', 'us', 'they', 'himself', 'herself', 'we']
  • 例数: 5746

  • 内訳: 陽性 2873陰性 2873
  • 学習データ数: 4607
  • テストデータ数: 1139
  • 学習反復回数: 21
  • テスト AUC: 0.87
Pythonで学ぶ Spark SQL 入門

文末語の予測

  • ポジティブラベル: 'it'

  • 例数: 438

  • 内訳: 陽性 219陰性 219
  • 学習データ数: 340
  • テストデータ数: 98
  • テスト AUC: 0.85
Pythonで学ぶ Spark SQL 入門

練習しましょう!

Pythonで学ぶ Spark SQL 入門

Preparing Video For Download...