PySpark の紹介

PySpark 入門

Benjamin Schmidt

Data Engineer

講師の紹介

  • PySparkによる約10年のデータ経験
  • 機械学習、ETL タスクなど、さまざまな用途で PySpark が使用される

  • 新しいツールを皆に教える熱心な講師!-Ben Schmidt

PySpark 入門

PySparkとは何ですか?

  • 分散データ処理: 複数のクラスターにまたがる大規模データセットを処理するよう設計されています

  • CSV、Parquet、JSON{{2}}を含むさまざまなデータ形式をサポート

  • SQL統合により、Python構文とSQL構文の両方を使用してデータをクエリできます

  • 大規模な高速化に最適化

データエコシステム

PySpark 入門

PySpark はいつ使用するのか

  • ビッグデータ分析

  • 分散データ処理

  • リアルタイムデータ配信

  • 大規模データセットでの機械学習

  • ETLとELTパイプライン

  • 多様なデータソースの取り扱い:

    1. CSV
      • JSON
    2. Parquet
    3. その他多数
PySpark 入門

Sparkクラスタ

マスターノード

  • クラスターを管理し、タスクを調整し、ジョブをスケジュールします

ワーカーノード

  • 上司から割り当てられたタスクを実行する
  • 実際の計算を実行し、データをメモリまたはディスクに保存する役割を担う

マスターノード

ワーカーノード

PySpark 入門

SparkSession

  • SparkSession を使用すると Spark クラスターにアクセスでき、PySpark を使用するために不可欠です。
# Import SparkSession
from pyspark.sql import SparkSession

# Initialize a SparkSession
spark = SparkSession.builder.appName("MySparkApp").getOrCreate()

$$

  • .builder() はセッション {{2}} を設定します
  • getOrCreate() はセッション {{3}} を作成または取得します
  • .appName() は複数のセッションの管理に役立ちます
PySpark 入門

PySpark DataFrames

  • 他の DataFrame と似ていますが
  • PySpark向けに最適化済み
# Import and initialize a Spark session
from pyspark.sql import SparkSession
spark = SparkSession.builder.appName("MySparkApp").getOrCreate()

# Create a DataFrame
census_df = spark.read.csv("census.csv",
                ["gender","age","zipcode","salary_range_usd","marriage_status"])

# Show the DataFrame
census_df.show()

PySpark 入門

練習しましょう!

PySpark 入門

Preparing Video For Download...