Studium przypadku: dane strumieniowe
Strumieniowanie danych z AWS Kinesis i Lambda
Maksim Pecherskiy
Data Engineer
Ten rozdział
Wysyłanie danych przychodzących do Firehose
Przechowywanie danych
Wizualizacja danych
Ustawianie alertów w czasie rzeczywistym
Monitorowanie strumienia
Spełnienie zestawu wymagań
Wymagania
Tweety muszą zawierać hashtag #sandiego
Tweety muszą napływać w czasie rzeczywistym
Tweety muszą być wzbogacone o analizę sentymentu
Wizualizacja danych z ostatnich 15 minut
Powiadamianie menedżera, gdy >3 negatywne tweety w ciągu 5 minut
Strumień powinien minimalizować utratę danych podczas przestojów
Dane muszą być przechowywane do późniejszej analizy
Tweety napływają w czasie rzeczywistym
Wzbogacone o analizę sentymentu
Dane muszą być przechowywane do późniejszej analizy
Wizualizacja ostatnich 15 minut
Redshift a Elasticsearch
Redshift
Zaprojektowany do przechowywania czystych tabel danych
Schemat zdefiniowany w bazie danych
Zapytania w SQL
Współpracuje z narzędziami BI, np. Tableau
Elasticsearch
Bezschematowy – dobry do logów i tekstu
Schemat tworzony podczas zapytania
Własny język zapytań
Własny interfejs – Kibana
Czas na ćwiczenia!
Strumieniowanie danych z AWS Kinesis i Lambda
Preparing Video For Download...