PySpark เบื้องต้น
Benjamin Schmidt
Data Engineer
ใช้ PySpark สำหรับ Machine Learning, งาน ETL และอื่น ๆ อีกมาก
ผู้สอนที่หลงใหลในการแนะนำเครื่องมือใหม่ ๆ
-
การประมวลผลข้อมูลแบบกระจาย: ออกแบบมาเพื่อจัดการชุดข้อมูลขนาดใหญ่บนคลัสเตอร์
รองรับรูปแบบข้อมูลหลากหลาย ทั้ง CSV, Parquet และ JSON
การผสาน SQL ช่วยให้คิวรีข้อมูลได้ทั้ง Python และ SQL
เพิ่มประสิทธิภาพสำหรับความเร็วในการทำงานที่ขนาดใหญ่

การวิเคราะห์ข้อมูลขนาดใหญ่
การประมวลผลข้อมูลแบบกระจาย
การสตรีมข้อมูลแบบเรียลไทม์
Machine learning บนชุดข้อมูลขนาดใหญ่
ETL และ ELT pipeline
รองรับแหล่งข้อมูลที่หลากหลาย:


# Import SparkSession
from pyspark.sql import SparkSession
# Initialize a SparkSession
spark = SparkSession.builder.appName("MySparkApp").getOrCreate()
$$
.builder() ตั้งค่า sessiongetOrCreate() สร้างหรือดึง session ที่มีอยู่.appName() ช่วยจัดการหลาย session# Import and initialize a Spark session
from pyspark.sql import SparkSession
spark = SparkSession.builder.appName("MySparkApp").getOrCreate()
# Create a DataFrame
census_df = spark.read.csv("census.csv",
["gender","age","zipcode","salary_range_usd","marriage_status"])
# Show the DataFrame
census_df.show()
PySpark เบื้องต้น