Klasyfikacja tekstu

Wprowadzenie do Spark SQL w Pythonie

Mark Plutowski

Data Scientist

Przewidywanie końcówki

Wprowadzenie do Spark SQL w Pythonie

Strzałka sekwencji

Wprowadzenie do Spark SQL w Pythonie

Końcówka

Wprowadzenie do Spark SQL w Pythonie

Nawias końcówki

Wprowadzenie do Spark SQL w Pythonie

Shuffle 1

Wprowadzenie do Spark SQL w Pythonie

Shuffle 2

Wprowadzenie do Spark SQL w Pythonie

Piosenki

Wprowadzenie do Spark SQL w Pythonie

Filmy

Wprowadzenie do Spark SQL w Pythonie

Wybieranie danych

df_true = df.where("endword in ('she', 'he', 'hers', 'his', 'her', 'him')")\
            .withColumn('label', lit(1))

df_false = df.where("endword not in ('she', 'he', 'hers', 'his', 'her', 'him')")\
           .withColumn('label', lit(0))
Wprowadzenie do Spark SQL w Pythonie

Łączenie danych pozytywnych i negatywnych

df_examples = df_true.union(df_false)
Wprowadzenie do Spark SQL w Pythonie

Podział danych na zbiory treningowy i ewaluacyjny

df_train, df_eval = df_examples.randomSplit((0.60, 0.40), 42)
Wprowadzenie do Spark SQL w Pythonie

Trenowanie

from pyspark.ml.classification import LogisticRegression

logistic = LogisticRegression(maxIter=50, regParam=0.6, elasticNetParam=0.3)
model = logistic.fit(df_train)
print("Training iterations: ", model.summary.totalIterations)
Wprowadzenie do Spark SQL w Pythonie

Czas na ćwiczenia!

Wprowadzenie do Spark SQL w Pythonie

Preparing Video For Download...