使用 PySpark 进行机器学习
Andrew Collier
Data Scientist, Fathom Data

与 Spark 交互的语言:
在 Python 中导入 pyspark 模块。
import pyspark
查看 pyspark 模块版本。
pyspark.__version__
'2.4.1'
除 pyspark 外还有:
pyspark.sqlpyspark.streamingpyspark.mllib(弃用)与 pyspark.ml使用 Spark URL 的远程集群 — spark://<IP address | DNS name>:<port>
示例:
spark://13.59.151.161:7077本地集群
示例:
local — 仅 1 个核心;local[4] — 4 个核心;或local[*] — 所有可用核心。from pyspark.sql import SparkSession
使用 SparkSession 构建器创建本地集群。
spark = SparkSession.builder \
.master('local[*]') \
.appName('first_spark_application') \
.getOrCreate()
开始与 Spark 交互…
# 关闭与 Spark 的连接
>>> spark.stop()
使用 PySpark 进行机器学习