Основи Big Data з PySpark
Upendra Devisetty
Science Analyst, CyVerse
Розділ 1: Основи BigData та вступ до Spark як фреймворку розподілених обчислень
Основні компоненти: Spark Core і вбудовані бібліотеки — Spark SQL, Spark MLlib, GraphX і Spark Streaming
PySpark: Python API Apache Spark для виконання Spark-завдань
Оболонка PySpark: для розробки інтерактивних застосунків на Python
Режими Spark: локальний і кластерний
Розділ 2: Вступ до RDD, їхні можливості, способи створення та операції над RDD (перетворення і дії)
Розділ 3: Вступ до Spark SQL, абстракція DataFrame, створення DataFrame, операції з DataFrame і візуалізація Big Data через DataFrame
Розділ 4: Вступ до Spark MLlib, три «C» машинного навчання (collaborative filtering, classification, clustering)
Основи Big Data з PySpark