PySpark 入門
Benjamin Schmidt
Data Engineer
機械学習、ETL タスクなど、さまざまな用途で PySpark が使用される
新しいツールを皆に教える熱心な講師!-
分散データ処理: 複数のクラスターにまたがる大規模データセットを処理するよう設計されています
CSV、Parquet、JSON{{2}}を含むさまざまなデータ形式をサポート
SQL統合により、Python構文とSQL構文の両方を使用してデータをクエリできます
大規模な高速化に最適化

ビッグデータ分析
分散データ処理
リアルタイムデータ配信
大規模データセットでの機械学習
ETLとELTパイプライン
多様なデータソースの取り扱い:


# Import SparkSession
from pyspark.sql import SparkSession
# Initialize a SparkSession
spark = SparkSession.builder.appName("MySparkApp").getOrCreate()
$$
.builder() はセッション {{2}} を設定しますgetOrCreate() はセッション {{3}} を作成または取得します.appName() は複数のセッションの管理に役立ちます# Import and initialize a Spark session
from pyspark.sql import SparkSession
spark = SparkSession.builder.appName("MySparkApp").getOrCreate()
# Create a DataFrame
census_df = spark.read.csv("census.csv",
["gender","age","zipcode","salary_range_usd","marriage_status"])
# Show the DataFrame
census_df.show()
PySpark 入門