Uczenie maszynowe z PySpark
Andrew Collier
Data Scientist, Fathom Data

Języki do pracy ze Spark.
Importowanie modułu pyspark w Pythonie.
import pyspark
Sprawdzenie wersji modułu pyspark.
pyspark.__version__
'2.4.1'
Oprócz pyspark dostępne są również:
pyspark.sqlpyspark.streamingpyspark.mllib (przestarzały) i pyspark.mlKlaster zdalny z użyciem adresu URL Spark — spark://<IP address | DNS name>:<port>
Przykład:
spark://13.59.151.161:7077Klaster lokalny
Przykłady:
local — tylko 1 rdzeń;local[4] — 4 rdzenie; lublocal[*] — wszystkie dostępne rdzenie.from pyspark.sql import SparkSession
Tworzenie klastra lokalnego przy użyciu konstruktora SparkSession.
spark = SparkSession.builder \
.master('local[*]') \
.appName('first_spark_application') \
.getOrCreate()
Praca ze Spark...
# Close connection to Spark
>>> spark.stop()
Uczenie maszynowe z PySpark