PySpark 入門
Benjamin Schmidt
Data Engineer
使用 PySpark 做機器學習、ETL 等多種任務
熱衷教學,帶你上手新工具!
-
分散式資料處理:可在叢集上處理大型資料集
支援多種格式:CSV、Parquet、JSON
整合 SQL,可用 Python 與 SQL 查詢資料
為大規模運算最佳化、速度快

大數據分析
分散式資料處理
即時資料串流
大型資料集上的機器學習
ETL 與 ELT 流水線
連接多元資料來源:


# Import SparkSession
from pyspark.sql import SparkSession
# Initialize a SparkSession
spark = SparkSession.builder.appName("MySparkApp").getOrCreate()
$$
.builder() 建立工作階段getOrCreate() 建立或取得工作階段.appName() 方便管理多個工作階段# Import and initialize a Spark session
from pyspark.sql import SparkSession
spark = SparkSession.builder.appName("MySparkApp").getOrCreate()
# Create a DataFrame
census_df = spark.read.csv("census.csv",
["gender","age","zipcode","salary_range_usd","marriage_status"])
# Show the DataFrame
census_df.show()
PySpark 入門