Кейс: потокові дані
Потокові дані з AWS Kinesis і Lambda
Maksim Pecherskiy
Data Engineer
У цьому розділі
Надсилати вхідні дані до Firehose
Зберігати дані
Візуалізувати дані
Налаштувати сповіщення в реальному часі
Моніторити потік
Виконати набір вимог
Вимоги
Твіти мають містити хештег #sandiego
Твіти мають надходити в реальному часі
Твіти мають бути збагачені сентиментом
Візуалізувати останні 15 хвилин даних
Сповістити менеджера, якщо >3 негативні твіти за 5 хвилин
Потік має мінімізувати втрати даних під час простоїв
Дані мають зберігатися для подальшого аналізу
Твіти надходять у реальному часі
Збагачені сентиментом
Дані мають зберігатися для подальшого аналізу
Візуалізувати останні 15 хвилин
Redshift проти Elasticsearch
Redshift
Створений для зберігання чистих таблиць даних
Схема визначена в базі даних
SQL для запитів
Чудово працює з BI-інструментами на кшталт Tableau
Elasticsearch
Без схеми — добре для логів і тексту
Схема формується під час запиту
Використовує власну мову запитів
Має власний інтерфейс — Kibana
Давайте потренуємось!
Потокові дані з AWS Kinesis і Lambda
Preparing Video For Download...