PySpark 入门
Benjamin Schmidt
Data Engineer
使用 PySpark 做机器学习、ETL 等
热衷于为所有人讲授新工具
-
分布式数据处理:在集群上处理海量数据
支持多种数据格式:CSV、Parquet、JSON 等
SQL 集成:可用 Python 或 SQL 查询数据
面向规模的高性能优化

大数据分析
分布式数据处理
实时数据流处理
大规模机器学习
ETL/ELT 流水线
连接多种数据源:


# Import SparkSession
from pyspark.sql import SparkSession
# Initialize a SparkSession
spark = SparkSession.builder.appName("MySparkApp").getOrCreate()
$$
.builder() 配置会话getOrCreate() 创建或获取会话.appName() 便于管理多个会话# Import and initialize a Spark session
from pyspark.sql import SparkSession
spark = SparkSession.builder.appName("MySparkApp").getOrCreate()
# Create a DataFrame
census_df = spark.read.csv("census.csv",
["gender","age","zipcode","salary_range_usd","marriage_status"])
# Show the DataFrame
census_df.show()
PySpark 入门