PySpark入門
Benjamin Schmidt
Data Engineer
機械学習、ETLなどでPySparkを活用
新ツールの指導に情熱あり
-
分散処理:クラスターで大規模データを処理
CSV、Parquet、JSONなど多様な形式に対応
SQL統合:Python/SQLの両方でクエリ可能
大規模でも高速に最適化

ビッグデータ分析
分散データ処理
リアルタイムストリーミング
大規模データでの機械学習
ETL・ELTパイプライン
多様なデータソース


# Import SparkSession
from pyspark.sql import SparkSession
# Initialize a SparkSession
spark = SparkSession.builder.appName("MySparkApp").getOrCreate()
$$
.builder() セッションを設定getOrCreate() 新規作成または取得.appName() 複数セッションの管理に役立つ# Import and initialize a Spark session
from pyspark.sql import SparkSession
spark = SparkSession.builder.appName("MySparkApp").getOrCreate()
# Create a DataFrame
census_df = spark.read.csv("census.csv",
["gender","age","zipcode","salary_range_usd","marriage_status"])
# Show the DataFrame
census_df.show()
PySpark入門