PySpark 입문
Benjamin Schmidt
Data Engineer
PySpark를 머신 러닝, ETL 등 다양한 작업에 활용
모두를 위한 새 도구 교육에 열정적입니다
-
분산 데이터 처리: 클러스터 전반의 대규모 데이터 처리에 적합
CSV, Parquet, JSON 등 다양한 형식 지원
SQL 통합: Python과 SQL 문법 모두로 질의 가능
대규모 처리에 최적화된 속도

빅데이터 분석
분산 데이터 처리
실시간 스트리밍
대규모 데이터셋 머신 러닝
ETL 및 ELT 파이프라인
다양한 데이터 소스 활용:


# Import SparkSession
from pyspark.sql import SparkSession
# Initialize a SparkSession
spark = SparkSession.builder.appName("MySparkApp").getOrCreate()
$$
.builder()는 세션을 설정합니다getOrCreate()는 세션을 생성하거나 반환합니다.appName()은 여러 세션 관리를 돕습니다# Import and initialize a Spark session
from pyspark.sql import SparkSession
spark = SparkSession.builder.appName("MySparkApp").getOrCreate()
# Create a DataFrame
census_df = spark.read.csv("census.csv",
["gender","age","zipcode","salary_range_usd","marriage_status"])
# Show the DataFrame
census_df.show()
PySpark 입문