Ładowanie

Wprowadzenie do inżynierii danych

Vincent Vankrunkelsven

Data Engineer @ DataCamp

Bazy analityczne i transakcyjne

Analityka

Ikona reprezentująca analitykę

  • Zapytania agregujące
  • Przetwarzanie analityczne (OLAP)

Aplikacje

Ikona reprezentująca aplikacje

  • Wiele transakcji
  • Przetwarzanie transakcji (OLTP)
Wprowadzenie do inżynierii danych

Orientacja kolumnowa i wierszowa

Analityka

  • Zorientowana kolumnowo

Przykład przechowywania kolumnowego

  • Zapytania o podzbiór kolumn
  • Zrównoleglenie

Aplikacje

  • Zorientowana wierszowo

Przykład przechowywania wierszowego

  • Przechowywane rekord po rekordzie
  • Dodawane na transakcję
  • Np. szybkie dodawanie klienta
Wprowadzenie do inżynierii danych

Bazy danych MPP

Bazy danych z masowym przetwarzaniem równoległym

Diagram bazy MPP

 

  • Amazon Redshift
  • Azure SQL Data Warehouse
  • Google BigQuery
Wprowadzenie do inżynierii danych

Przykład: Redshift

Ładowanie pliku do kolumnowego formatu przechowywania

# Pandas .to_parquet() method
df.to_parquet("./s3://path/to/bucket/customer.parquet")
# PySpark .write.parquet() method
df.write.parquet("./s3://path/to/bucket/customer.parquet")
COPY customer
FROM 's3://path/to/bucket/customer.parquet'
FORMAT as parquet
...
Wprowadzenie do inżynierii danych

Ładowanie do PostgreSQL

pandas.to_sql()

# Transformation on data
recommendations = transform_find_recommendatins(ratings_df)

# Load into PostgreSQL database
recommendations.to_sql("recommendations",
                       db_engine,
                       schema="store",
                       if_exists="replace")
Wprowadzenie do inżynierii danych

Czas na ćwiczenia!

Wprowadzenie do inżynierii danych

Preparing Video For Download...