Transformacja danych z pandas

ETL i ELT w Pythonie

Jake Roach

Data Engineer

Transformacja danych w potoku

Dane muszą być odpowiednio przekształcone, aby były wartościowe dla dalszych użytkowników

Przepływ pracy transformacji danych.

pandas oferuje zaawansowane narzędzia do transformacji danych tabelarycznych

  • .loc[]
  • .to_datetime()
ETL i ELT w Pythonie

Filtrowanie rekordów za pomocą .loc[]

.loc[] umożliwia transformację obu wymiarów DataFrame

# Keep only non-zero entries
cleaned = raw_stock_data.loc[raw_stock_data["open"] > 0, :]
# Remove excess columns
cleaned = raw_stock_data.loc[:, ["timestamps", "open", "close"]]
# Combine into one step
cleaned = raw_stock_data.loc[raw_stock_data["open"] > 0, ["timestamps", "open", "close"]]

.iloc[] używa indeksowania całkowitoliczbowego do filtrowania DataFrame

cleaned = raw_stock_data.iloc[[0:50], [0, 1, 2]]
ETL i ELT w Pythonie

Zmiana typów danych

Typy danych często wymagają konwersji do dalszego przetwarzania

  • .to_datetime()
# "timestamps" column currectly looks like: "20230101085731"
# Convert "timestamps" column to type datetime
cleaned["timestamps"] = pd.to_datetime(cleaned["timestamps"], format="%Y%m%d%H%M%S")
Timestamp('2023-01-01 08:57:31')
# "timestamps" column currently looks like: 1681596000011
# Convert "timestamps" column to type datatime
cleaned["timestamps"] = pd.to_datetime(cleaned["timestamps"], unit="ms")
Timestamp('2023-04-15 22:00:00.011000')
ETL i ELT w Pythonie

Weryfikacja transformacji

Transformacja danych wiąże się z ryzykiem:

  • Utrata informacji
  • Tworzenie błędnych danych
# Several ways to investigate a DataFrame
cleaned = raw_stock_data.loc[raw_stock_data["open"] > 0, ["timestamps", "open", "close"]]
print(cleaned.head())
# Return smallest and largest records
print(cleaned.nsmallest(10, ["timestamps"]))
print(cleaned.nlargest(10, ["timestamps"]))
ETL i ELT w Pythonie

Czas na ćwiczenia!

ETL i ELT w Pythonie

Preparing Video For Download...