连接 Spark

使用 PySpark 进行机器学习

Andrew Collier

Data Scientist, Fathom Data

与 Spark 交互

Java、Scala、Python 和 R 的标志。

与 Spark 交互的语言:

  • Java — 低层、编译型
  • Scala、Python、R — 高层,支持交互式 REPL
使用 PySpark 进行机器学习

导入 pyspark

在 Python 中导入 pyspark 模块。

import pyspark

查看 pyspark 模块版本。

pyspark.__version__
'2.4.1'
使用 PySpark 进行机器学习

子模块

pyspark 外还有:

使用 PySpark 进行机器学习

Spark URL

使用 Spark URL 的远程集群spark://<IP address | DNS name>:<port>

示例:

  • spark://13.59.151.161:7077

本地集群

示例:

  • local — 仅 1 个核心;
  • local[4] — 4 个核心;或
  • local[*] — 所有可用核心。
使用 PySpark 进行机器学习

创建 SparkSession

from pyspark.sql import SparkSession

使用 SparkSession 构建器创建本地集群。

spark = SparkSession.builder \
                    .master('local[*]') \
                    .appName('first_spark_application') \
                    .getOrCreate()

开始与 Spark 交互…

# 关闭与 Spark 的连接
>>> spark.stop()
使用 PySpark 进行机器学习

让我们连接 Spark!

使用 PySpark 进行机器学习

Preparing Video For Download...