Studium przypadku: dane strumieniowe

Strumieniowanie danych z AWS Kinesis i Lambda

Maksim Pecherskiy

Data Engineer

Ten rozdział

  • Wysyłanie danych przychodzących do Firehose
  • Przechowywanie danych
  • Wizualizacja danych
  • Ustawianie alertów w czasie rzeczywistym
  • Monitorowanie strumienia
  • Spełnienie zestawu wymagań
Strumieniowanie danych z AWS Kinesis i Lambda

2020-08-11_18-31.png

Strumieniowanie danych z AWS Kinesis i Lambda

Wymagania

  • Tweety muszą zawierać hashtag #sandiego
  • Tweety muszą napływać w czasie rzeczywistym
  • Tweety muszą być wzbogacone o analizę sentymentu
  • Wizualizacja danych z ostatnich 15 minut
  • Powiadamianie menedżera, gdy >3 negatywne tweety w ciągu 5 minut
  • Strumień powinien minimalizować utratę danych podczas przestojów
  • Dane muszą być przechowywane do późniejszej analizy
Strumieniowanie danych z AWS Kinesis i Lambda

Tweety napływają w czasie rzeczywistym

2020-08-02_08-38.png

Strumieniowanie danych z AWS Kinesis i Lambda

Wzbogacone o analizę sentymentu

Strumieniowanie danych z AWS Kinesis i Lambda

Dane muszą być przechowywane do późniejszej analizy

2020-08-02_08-42.png

Strumieniowanie danych z AWS Kinesis i Lambda

Wizualizacja ostatnich 15 minut

2020-08-11_18-44.png

Strumieniowanie danych z AWS Kinesis i Lambda

Redshift a Elasticsearch

Redshift

  • Zaprojektowany do przechowywania czystych tabel danych
  • Schemat zdefiniowany w bazie danych
  • Zapytania w SQL
  • Współpracuje z narzędziami BI, np. Tableau

Elasticsearch

  • Bezschematowy – dobry do logów i tekstu
  • Schemat tworzony podczas zapytania
  • Własny język zapytań
  • Własny interfejs – Kibana
Strumieniowanie danych z AWS Kinesis i Lambda

Czas na ćwiczenia!

Strumieniowanie danych z AWS Kinesis i Lambda

Preparing Video For Download...