Збереження даних

Проєктування баз даних

Lis Sulmont

Curriculum Manager

Структурування даних

1. Структуровані дані  

  • Дотримуються схеми
  • Визначені типи даних і зв'язки

напр., SQL, таблиці в реляційній БД

2. Неструктуровані дані  

  • Без схеми
  • Переважають у світі даних

напр., фото, журнали чатів, MP3

3. Напівструктуровані дані

  • Не дотримуються загальної схеми
  • Самоописна структура

напр., NoSQL, XML, JSON

# Example of a JSON file
"user": {
     "profile_use_background_image": true, 
     "statuses_count": 31, 
     "profile_background_color": "C0DEED", 
     "followers_count": 3066, 
     ...
Проєктування баз даних

Структурування даних

Діаграма спектра між структурованими й неструктурованими даними

1 Flower by Sam Oth and Database Diagram by Nick Jenkins via Wikimedia Commons https://commons.wikimedia.org/wiki/File:Languages_xml.png
Проєктування баз даних

Збереження даних поза традиційними БД

  • Традиційні бази даних
    • Для зберігання оперативних реляційних структурованих даних ⟶ OLTP
  • Сховища даних
    • Для аналізу архівованих структурованих даних ⟶ OLAP
  • Озера даних
    • Для зберігання даних усіх структур = гнучкість і масштабованість
    • Для аналізу big data
Проєктування баз даних

Сховища даних

  • Оптимізовані під аналітику — OLAP
    • Організовані для читання/агрегації даних
    • Зазвичай лише для читання
  • Містять дані з кількох джерел
  • Масово паралельна обробка (MPP)
  • Типово денормалізована схема й вимірне моделювання

Вітрини даних

  • Підмножина сховищ даних
  • Присвячені окремій темі

Amazon Redshift, Google Bog Query and Azure SQL Data Warehouse

Вітрина даних як підмножина сховища даних

Проєктування баз даних

Озера даних

  • Зберігають усі типи даних за меншої вартості:
    • напр., сирі, операційні БД, журнали IoT, реальний час, реляційні й нереляційні
  • Утримують усі дані, обсяги — до петабайтів
  • Schema-on-read на відміну від schema-on-write
  • Потрібен каталог, інакше перетворяться на болото даних
  • Запускають big data аналітику через сервіси на кшталт Apache Spark та Hadoop
    • Корисні для глибокого навчання й дослідження даних, бо потрібні дуже великі обсяги

Amazon, Google і Microsoft пропонують рішення Data Lakes

Проєктування баз даних

ETL

ELT

Проєктування баз даних

Давайте потренуємось!

Проєктування баз даних

Preparing Video For Download...