Připojení ke Sparku

Machine Learning with PySpark

Andrew Collier

Data Scientist, Fathom Data

Práce se Sparkem

Loga jazyků Java, Scala, Python a R.

Jazyky pro práci se Sparkem.

  • Java — nízkoúrovňový, kompilovaný
  • Scala, Python a R — vysokoúrovňové s interaktivním REPL
Machine Learning with PySpark

Import pyspark

Z Pythonu importujte modul pyspark.

import pyspark

Zkontrolujte verzi modulu pyspark.

pyspark.__version__
'2.4.1'
Machine Learning with PySpark

Podmoduly

Kromě pyspark jsou k dispozici

Machine Learning with PySpark

Spark URL

Vzdálený cluster pomocí Spark URL — spark://<IP address | DNS name>:<port>

Příklad:

  • spark://13.59.151.161:7077

Lokální cluster

Příklady:

  • local — pouze 1 jádro;
  • local[4] — 4 jádra; nebo
  • local[*] — všechna dostupná jádra.
Machine Learning with PySpark

Vytvoření SparkSession

from pyspark.sql import SparkSession

Vytvořte lokální cluster pomocí builderu SparkSession.

spark = SparkSession.builder \
                    .master('local[*]') \
                    .appName('first_spark_application') \
                    .getOrCreate()

Práce se Sparkem...

# Close connection to Spark
>>> spark.stop()
Machine Learning with PySpark

Připojme se ke Sparku!

Machine Learning with PySpark

Preparing Video For Download...