集群规模调整提示

使用 PySpark 进行数据清洗

Mike Metzger

Data Engineering Consultant

配置选项

  • Spark 有许多配置项
  • 可按需修改
  • 读取配置:
    spark.conf.get(<configuration name>)
    
  • 写入配置
    spark.conf.set(<configuration name>)
    
使用 PySpark 进行数据清洗

集群类型

Spark 部署选项:

  • 单节点
  • 独立模式
  • 托管模式
    • YARN
    • Mesos
    • Kubernetes
使用 PySpark 进行数据清洗

Driver

  • 任务分配
  • 结果汇总
  • 共享数据访问

提示:

  • Driver 节点内存应为 Worker 的两倍
  • 速度快的本地存储有益
使用 PySpark 进行数据清洗

Worker

  • 执行实际任务
  • 理想情况下具备该任务的全部代码、数据与资源

建议:

  • 多个较小的 Worker 往往优于更大的 Worker
  • 通过测试找到平衡
  • 快速本地存储非常有用
使用 PySpark 进行数据清洗

¡Vamos a practicar!

使用 PySpark 进行数据清洗

Preparing Video For Download...