예측과 평가

Python에서 Spark SQL 입문

Mark Plutowski

Data Scientist

평가 데이터에 모델 적용

predicted = df_trained.transform(df_test)
  • prediction 열: double
  • probability 열: 길이 2의 벡터
x = predicted.first
print("Right!" if x.label == int(x.prediction) else "Wrong")
Python에서 Spark SQL 입문

분류 정확도 평가

model_stats = model.evaluate(df_eval)
type(model_stats)
pyspark.ml.classification.BinaryLogisticRegressionSummary)
print("\nPerformance: %.2f" % model_stats.areaUnderROC)
Python에서 Spark SQL 입문

텍스트 분류 예시

  • 양성 레이블:

    • ['her', 'him', 'he', 'she', 'them', 'us', 'they', 'himself', 'herself', 'we']
  • 예시 개수: 5746

  • 예시 개수: 양성 2873, 음성 2873
  • 학습 예시: 4607
  • 테스트 예시: 1139
  • 학습 반복: 21
  • 테스트 AUC: 0.87
Python에서 Spark SQL 입문

끝 단어 예측

  • 양성 레이블: 'it'

  • 예시 개수: 438

  • 예시 개수: 양성 219, 음성 219
  • 학습 예시: 340
  • 테스트 예시: 98
  • 테스트 AUC: 0.85
Python에서 Spark SQL 입문

연습해 봅시다!

Python에서 Spark SQL 입문

Preparing Video For Download...