Étude de cas : données en continu

Données en continu avec AWS Kinesis et Lambda

Maksim Pecherskiy

Data Engineer

Dans ce chapitre

  • Acheminer les données entrantes vers Firehose
  • Stocker les données
  • Visualiser les données
  • Configurer des alertes en temps réel
  • Surveiller le flux
  • Respecter un ensemble d'exigences
Données en continu avec AWS Kinesis et Lambda

2020-08-11_18-31.png

Données en continu avec AWS Kinesis et Lambda

Exigences

  • Les tweets doivent inclure le mot-clic #sandiego
  • Les tweets doivent arriver en temps réel
  • Les tweets doivent être enrichis d'un score de sentiment
  • Visualiser les 15 dernières minutes de données
  • Avertir le gestionnaire si >3 tweets négatifs en 5 minutes
  • Le flux doit réduire au minimum les pertes dues aux arrêts
  • Les données doivent persister pour une analyse ultérieure
Données en continu avec AWS Kinesis et Lambda

Tweets en temps réel

2020-08-02_08-38.png

Données en continu avec AWS Kinesis et Lambda

Enrichis d'un sentiment

Données en continu avec AWS Kinesis et Lambda

Les données doivent persister pour analyse ultérieure

2020-08-02_08-42.png

Données en continu avec AWS Kinesis et Lambda

Visualiser les 15 dernières minutes

2020-08-11_18-44.png

Données en continu avec AWS Kinesis et Lambda

Redshift vs Elasticsearch

Redshift

  • Conçu pour stocker des tables de données propres
  • Schéma défini dans la base de données
  • SQL pour les requêtes
  • S'intègre bien aux outils BI comme Tableau

Elasticsearch

  • Sans schéma : idéal pour journaux et texte
  • Schéma créé lors de la requête
  • Utilise son propre langage de requêtes
  • Possède sa propre interface : Kibana
Données en continu avec AWS Kinesis et Lambda

Passons à la pratique !

Données en continu avec AWS Kinesis et Lambda

Preparing Video For Download...