大数据基础

使用 PySpark 的大数据基础

Upendra Devisetty

Science Analyst, CyVerse

什么是大数据?

  • 大数据指研究与应用传统数据处理软件难以处理的复杂数据集的领域——维基百科
使用 PySpark 的大数据基础

大数据的 3V

  • 体量、种类、速度

  • 体量(Volume):数据规模

  • 种类(Variety):来源与格式多样

  • 速度(Velocity):数据产生与处理速度

使用 PySpark 的大数据基础

大数据概念与术语

  • 集群计算: 多台机器资源的集合

  • 并行计算: 单机上的并行计算

  • 分布式计算: 多个联网节点并行运行

  • 批处理: 将作业拆分并在多机上执行

  • 实时处理: 立即处理数据

使用 PySpark 的大数据基础

大数据处理系统

  • Hadoop/MapReduce: 可扩展、具容错性的 Java 框架

    • 开源

    • 批处理

  • Apache Spark: 通用、极快的集群计算系统

    • 开源

    • 支持批处理与实时处理

  • 注意: 现今多倾向使用 Apache Spark,而非 Hadoop/MapReduce

使用 PySpark 的大数据基础

Apache Spark 的特性

  • 分布式集群计算框架

  • 面向大数据集的高效内存计算

  • 超快的数据处理框架

  • 支持 Java、Scala、Python、R 和 SQL

使用 PySpark 的大数据基础

Apache Spark 组件

spark

使用 PySpark 的大数据基础

Spark 部署模式

  • 本地模式: 单机,如您的笔记本电脑

    • 便于测试、调试与演示
  • 集群模式: 一组预配置的机器

    • 适合生产环境
  • 工作流:本地 -> 集群

  • 无需修改代码

使用 PySpark 的大数据基础

接下来:PySpark

使用 PySpark 的大数据基础

Preparing Video For Download...