Практический пример: потоковые данные
Потоковая обработка данных с AWS Kinesis и Lambda
Maksim Pecherskiy
Data Engineer
В этой главе
Отправка данных в Firehose
Хранение данных
Визуализация данных
Настройка оповещений в реальном времени
Мониторинг потока
Выполнение заданных требований
Требования
Твиты должны содержать хэштег #sandiego
Твиты должны поступать в реальном времени
Твиты должны содержать оценку тональности
Визуализация данных за последние 15 минут
Уведомление менеджера при >3 негативных твитах за 5 минут
Поток должен минимизировать потерю данных при сбоях
Данные должны сохраняться для последующего анализа
Твиты поступают в реальном времени
Обогащение оценкой тональности
Данные должны сохраняться для последующего анализа
Визуализация за последние 15 минут
Redshift vs Elasticsearch
Redshift
Предназначен для хранения структурированных таблиц
Схема задаётся в базе данных
SQL для запросов
Отлично интегрируется с BI-инструментами, например Tableau
Elasticsearch
Без схемы — подходит для логов и текста
Схема формируется во время запроса
Собственный язык запросов
Собственный интерфейс — Kibana
Давайте потренируемся!
Потоковая обработка данных с AWS Kinesis и Lambda
Preparing Video For Download...