使用 PySpark 的大数据基础
Upendra Devisetty
Science Analyst, CyVerse
体量、种类、速度
体量(Volume):数据规模
种类(Variety):来源与格式多样
速度(Velocity):数据产生与处理速度
集群计算: 多台机器资源的集合
并行计算: 单机上的并行计算
分布式计算: 多个联网节点并行运行
批处理: 将作业拆分并在多机上执行
实时处理: 立即处理数据
Hadoop/MapReduce: 可扩展、具容错性的 Java 框架
开源
批处理
Apache Spark: 通用、极快的集群计算系统
开源
支持批处理与实时处理
注意: 现今多倾向使用 Apache Spark,而非 Hadoop/MapReduce
分布式集群计算框架
面向大数据集的高效内存计算
超快的数据处理框架
支持 Java、Scala、Python、R 和 SQL

本地模式: 单机,如您的笔记本电脑
集群模式: 一组预配置的机器
工作流:本地 -> 集群
无需修改代码
使用 PySpark 的大数据基础