Big Data 基礎

使用 PySpark 的 Big Data 基礎

Upendra Devisetty

Science Analyst, CyVerse

什麼是 Big Data?

  • Big data 是指研究與應用那些對傳統資料處理軟體而言過於複雜的資料集——Wikipedia
使用 PySpark 的 Big Data 基礎

Big Data 的 3V

  • Volume、Variety、Velocity

  • Volume:資料規模

  • Variety:來源與格式多樣性

  • Velocity:資料產生與處理速度

使用 PySpark 的 Big Data 基礎

Big Data 概念與術語

  • Clustered computing:多部機器的資源集合

  • Parallel computing:單一電腦同時計算

  • Distributed computing:並行運作的節點(網路電腦)集合

  • Batch processing:將作業拆成小塊,在各機器上執行

  • Real-time processing:即時處理資料

使用 PySpark 的 Big Data 基礎

Big Data 處理系統

  • Hadoop/MapReduce: 以 Java 撰寫的可擴充、具容錯性的架構

    • 開源

    • 批次處理

  • Apache Spark: 通用且極速的叢集運算系統

    • 開源

    • 同時支援批次與即時處理

  • 注意: 現今多以 Apache Spark 取代 Hadoop/MapReduce

使用 PySpark 的 Big Data 基礎

Apache Spark 框架特色

  • 分散式叢集運算框架

  • 對大型資料集進行高效的記憶體內計算

  • 極速的資料處理框架

  • 支援 Java、Scala、Python、R 與 SQL

使用 PySpark 的 Big Data 基礎

Apache Spark 元件

spark

使用 PySpark 的 Big Data 基礎

Spark 部署模式

  • Local 模式: 單一機器,例如你的筆電

    • 方便測試、偵錯與示範
  • Cluster 模式: 一組預先配置的機器

    • 適合正式環境
  • 工作流程:Local -> Cluster

  • 不需更動程式碼

使用 PySpark 的 Big Data 基礎

接下來:PySpark

使用 PySpark 的 Big Data 基礎

Preparing Video For Download...