PySpark 入门
Benjamin Schmidt
Data Engineer

RDD(Resilient Distributed Dataset,弹性分布式数据集):
map()、filter() 等转换;用 collect() 等动作取结果,或用 paralelize() 创建 RDD# Initialize a Spark session from pyspark.sql import SparkSession spark = SparkSession.builder.appName("RDDExample").getOrCreate()# Create a DataFrame from a csv census_df = spark.read.csv("/census.csv")# Convert DataFrame to RDD census_rdd = census_df.rdd# Show the RDD's contents using collect() census_rdd.collect()
# Collect the entire DataFrame into a local Python list of Row objects
data_collected = df.collect()
# Print the collected data
for row in data_collected:
print(row)
```
map(): 将函数(含自定义函数,如 lambda)应用到数据集:
rdd.map(map_function)collect(): 从集群收集数据:
rdd.collect()PySpark 入门