クラスターのサイズ調整のコツ

PySpark でデータをクレンジングする

Mike Metzger

Data Engineering Consultant

設定オプション

  • Spark には多数の設定項目があります
  • ニーズに合わせて変更できます
  • 設定の読み取り:
    spark.conf.get(<configuration name>)
    
  • 設定の書き込み
    spark.conf.set(<configuration name>)
    
PySpark でデータをクレンジングする

クラスターの種類

Spark のデプロイ方法:

  • 単一ノード
  • スタンドアロン
  • マネージド
    • YARN
    • Mesos
    • Kubernetes
PySpark でデータをクレンジングする

ドライバー

  • タスク割り当て
  • 結果の集約
  • 共有データアクセス

ヒント:

  • ドライバーはワーカーの2倍のメモリが望ましい
  • 高速なローカルストレージが有用
PySpark でデータをクレンジングする

ワーカー

  • 実タスクを実行
  • 理想は、対象タスクのコード・データ・リソースをすべて保持

推奨:

  • 大きなワーカーより、ワーカーノードを増やす方が有効なことが多い
  • バランスは検証して決定
  • 高速なローカルストレージが非常に有用
PySpark でデータをクレンジングする

演習に進みましょう!

PySpark でデータをクレンジングする

Preparing Video For Download...