Основи Big Data з PySpark
Upendra Devisetty
Science Analyst, CyVerse
Обсяг, Різноманітність і Швидкість
Обсяг: розмір даних
Різноманітність: різні джерела й формати
Швидкість: темп надходження даних
Кластерні обчислення: сукупність ресурсів кількох машин
Паралельні обчислення: одночасні обчислення на одному комп'ютері
Розподілені обчислення: набір вузлів (мережевих комп'ютерів), що працюють паралельно
Пакетна обробка: поділ завдання на частини й запуск на окремих машинах
Обробка в реальному часі: негайна обробка даних
Hadoop/MapReduce: масштабована й відмовостійка платформа на Java
Відкритий код
Пакетна обробка
Apache Spark: універсальна й дуже швидка система кластерних обчислень
Відкритий код
Пакетна та потокова обробка даних
Примітка: нині Apache Spark зазвичай віддають перевагу над Hadoop/MapReduce
Розподілена платформа кластерних обчислень
Ефективні обчислення в пам'яті для великих наборів даних
Дуже швидка обробка даних
Підтримує Java, Scala, Python, R та SQL

Локальний режим: одна машина, наприклад ваш ноутбук
Кластерний режим: набір попередньо визначених машин
Робочий процес: локально -> кластери
Зміни в коді не потрібні
Основи Big Data з PySpark