Przetwarzanie wsadowe a strumieniowe

Koncepcje strumieniowania danych

Mike Metzger

Data Engineer

Krótkie podsumowanie

  • Przetwarzanie wsadowe obsługuje dane w grupach, czyli partiach
  • Kluczowe parametry to rozmiar partii i częstotliwość jej przetwarzania
  • Kolejki przechowują i przetwarzają dane w kolejności wstawiania
  • Kolejki to partie o rozmiarze jeden!
  • Strumienie przetwarzają dane bez przerw
  • Strumienie nie mają zdefiniowanego końca
  • Strumienie zachowują kolejność!
Koncepcje strumieniowania danych

Pożar!

  • Łańcuch z wiadrami
    • Rozmiar partii (jak duże jest wiadro)
    • Częstotliwość partii (jak szybko podawać wiadro)

Łańcuch z wiadrami

  • Wąż strażacki
    • Ciągły przepływ danych
    • Nieznana ilość wody

Wąż strażacki

1 Albert B. Kinne, domena publiczna, via Wikimedia Commons 2 Commander, U.S. Naval Forces Europe-Africa/U.S. 6th Fleet, domena publiczna, via Wikimedia Commons
Koncepcje strumieniowania danych

Jak wybrać najlepsze podejście?

  • Zależy od wymagań
  • Jeśli możliwe jest przetwarzanie w grupach, przetwarzanie wsadowe jest zwykle najprostsze
  • Jeśli wymagana jest kolejność, ale przerwy są dopuszczalne, należy użyć kolejki
  • Jeśli dane są ciągłe lub ich ilość jest nieznana, należy użyć strumieniowania
  • Jeśli nie można przerywać przetwarzania, należy użyć strumieniowania
Koncepcje strumieniowania danych

Czas na ćwiczenia!

Koncepcje strumieniowania danych

Preparing Video For Download...