Основи Big Data

Основи Big Data з PySpark

Upendra Devisetty

Science Analyst, CyVerse

Що таке Big Data?

  • Big data — термін для позначення вивчення та застосувань наборів даних, що надто складні для традиційного ПЗ обробки даних — Wikipedia
Основи Big Data з PySpark

3 V Big Data

  • Обсяг, Різноманітність і Швидкість

  • Обсяг: розмір даних

  • Різноманітність: різні джерела й формати

  • Швидкість: темп надходження даних

Основи Big Data з PySpark

Поняття та терміни Big Data

  • Кластерні обчислення: сукупність ресурсів кількох машин

  • Паралельні обчислення: одночасні обчислення на одному комп'ютері

  • Розподілені обчислення: набір вузлів (мережевих комп'ютерів), що працюють паралельно

  • Пакетна обробка: поділ завдання на частини й запуск на окремих машинах

  • Обробка в реальному часі: негайна обробка даних

Основи Big Data з PySpark

Системи обробки Big Data

  • Hadoop/MapReduce: масштабована й відмовостійка платформа на Java

    • Відкритий код

    • Пакетна обробка

  • Apache Spark: універсальна й дуже швидка система кластерних обчислень

    • Відкритий код

    • Пакетна та потокова обробка даних

  • Примітка: нині Apache Spark зазвичай віддають перевагу над Hadoop/MapReduce

Основи Big Data з PySpark

Можливості фреймворку Apache Spark

  • Розподілена платформа кластерних обчислень

  • Ефективні обчислення в пам'яті для великих наборів даних

  • Дуже швидка обробка даних

  • Підтримує Java, Scala, Python, R та SQL

Основи Big Data з PySpark

Компоненти Apache Spark

spark

Основи Big Data з PySpark

Режими розгортання Spark

  • Локальний режим: одна машина, наприклад ваш ноутбук

    • Зручно для тестування, налагодження й демонстрацій
  • Кластерний режим: набір попередньо визначених машин

    • Підходить для продакшну
  • Робочий процес: локально -> кластери

  • Зміни в коді не потрібні

Основи Big Data з PySpark

Далі — PySpark

Основи Big Data з PySpark

Preparing Video For Download...