Wczytywanie

Wprowadzenie do inżynierii danych

Vincent Vankrunkelsven

Data Engineer, DataCamp

Bazy danych: analityczne czy aplikacyjne

Analityka

Ikona reprezentująca analitykę

  • Zapytania agregujące
  • Przetwarzanie analityczne online (OLAP)

Aplikacje

Ikona reprezentująca aplikacje

  • Duża liczba transakcji
  • Przetwarzanie transakcyjne online (OLTP)
Wprowadzenie do inżynierii danych

Orientacja kolumnowa i wierszowa

Analityka

  • Orientacja kolumnowa

Przykład przechowywania danych w układzie kolumnowym

  • Zapytania dotyczące podzbioru kolumn
  • Równoległe przetwarzanie

Aplikacje

  • Orientacja wierszowa

Przykład przechowywania danych w układzie wierszowym

  • Zapis na poziomie rekordu
  • Dodawanie w ramach transakcji
  • Np. dodanie klienta jest szybkie
Wprowadzenie do inżynierii danych

Bazy danych MPP

Bazy danych z masowo równoległym przetwarzaniem

Schemat bazy danych MPP

 

  • Amazon Redshift
  • Azure SQL Data Warehouse
  • Google BigQuery
Wprowadzenie do inżynierii danych

Przykład: Redshift

Wczytywanie z pliku do formatu kolumnowego

# Pandas .to_parquet() method
df.to_parquet("s3://path/to/bucket/customer.parquet")
# PySpark .write.parquet() method
df.write.parquet("s3://path/to/bucket/customer.parquet")
COPY customer
FROM 's3://path/to/bucket/customer.parquet'
FORMAT as parquet
...
Wprowadzenie do inżynierii danych

Wczytywanie do PostgreSQL

pandas.to_sql()

# Transformation on data
recommendations = transform_find_recommendatins(ratings_df)

# Load into PostgreSQL database
recommendations.to_sql("recommendations",
                       db_engine,
                       schema="store",
                       if_exists="replace")
Wprowadzenie do inżynierii danych

Czas na praktykę!

Wprowadzenie do inżynierii danych

Preparing Video For Download...