Machine Learning with PySpark
Andrew Collier
Data Scientist, Fathom Data

Jazyky pro práci se Sparkem.
Z Pythonu importujte modul pyspark.
import pyspark
Zkontrolujte verzi modulu pyspark.
pyspark.__version__
'2.4.1'
Kromě pyspark jsou k dispozici
pyspark.sqlpyspark.streamingpyspark.mllib (zastaralé) a pyspark.mlVzdálený cluster pomocí Spark URL — spark://<IP address | DNS name>:<port>
Příklad:
spark://13.59.151.161:7077Lokální cluster
Příklady:
local — pouze 1 jádro;local[4] — 4 jádra; nebolocal[*] — všechna dostupná jádra.from pyspark.sql import SparkSession
Vytvořte lokální cluster pomocí builderu SparkSession.
spark = SparkSession.builder \
.master('local[*]') \
.appName('first_spark_application') \
.getOrCreate()
Práce se Sparkem...
# Close connection to Spark
>>> spark.stop()
Machine Learning with PySpark