Основы Big Data с PySpark
Upendra Devisetty
Science Analyst, CyVerse
Объём, Разнообразие и Скорость
Объём: размер данных
Разнообразие: различные источники и форматы
Скорость: скорость поступления данных
Кластерные вычисления: объединение ресурсов нескольких машин
Параллельные вычисления: одновременное выполнение задач на одном компьютере
Распределённые вычисления: узлы (сетевые компьютеры), работающие параллельно
Пакетная обработка: разбивка задачи на части и их выполнение на отдельных машинах
Обработка в реальном времени: немедленная обработка данных
Hadoop/MapReduce: масштабируемый отказоустойчивый фреймворк на Java
Открытый исходный код
Пакетная обработка
Apache Spark: универсальная высокопроизводительная система кластерных вычислений
Открытый исходный код
Пакетная и потоковая обработка данных
Примечание: Apache Spark сегодня предпочтительнее Hadoop/MapReduce
Распределённый фреймворк кластерных вычислений
Эффективные вычисления в памяти для больших наборов данных
Высокоскоростная обработка данных
Поддержка Java, Scala, Python, R и SQL

Локальный режим: одна машина, например ваш ноутбук
Режим кластера: набор заранее определённых машин
Рабочий процесс: локально → кластер
Изменение кода не требуется
Основы Big Data с PySpark