Основы Big Data с PySpark
Upendra Devisetty
Science Analyst, CyVerse
Глава 1: Основы больших данных и введение в Spark как фреймворк для распределённых вычислений
Основные компоненты: Spark Core и встроенные библиотеки — Spark SQL, Spark MLlib, GraphX и Spark Streaming
PySpark: Python API для Apache Spark, позволяющий запускать задания Spark
Оболочка PySpark: для разработки интерактивных приложений на Python
Режимы Spark: локальный и кластерный
Глава 2: Введение в RDD, их ключевые особенности, способы создания и операции с RDD (преобразования и действия)
Глава 3: Введение в Spark SQL, абстракция DataFrame, создание DataFrame, операции с ними и визуализация больших данных
Глава 4: Введение в Spark MLlib и три направления машинного обучения: коллаборативная фильтрация, классификация и кластеризация
Основы Big Data с PySpark