Wprowadzenie do PySpark

Wprowadzenie do PySpark

Benjamin Schmidt

Data Engineer

Poznaj swojego instruktora

  • Prawie dekada doświadczenia z PySpark
  • Wykorzystanie PySpark do uczenia maszynowego, zadań ETL i nie tylko

  • Entuzjastyczny nauczyciel nowych narzędzi!

-Ben Schmidt

Wprowadzenie do PySpark

Czym jest PySpark?

  • Rozproszone przetwarzanie danych: przeznaczone do obsługi dużych zbiorów danych w klastrach

  • Obsługuje różne formaty danych, w tym CSV, Parquet i JSON

  • Integracja z SQL umożliwia zapytania w Pythonie i SQL

  • Zoptymalizowane pod kątem szybkości na dużą skalę

Ekosystem danych

Wprowadzenie do PySpark

Kiedy używać PySpark?

  • Analityka big data

  • Rozproszone przetwarzanie danych

  • Strumieniowanie danych w czasie rzeczywistym

  • Uczenie maszynowe na dużych zbiorach danych

  • Potoki ETL i ELT

  • Praca z różnorodnymi źródłami danych:

    1. CSV
    2. JSON
    3. Parquet
    4. Wiele innych
Wprowadzenie do PySpark

Klaster Spark

Węzeł główny

  • Zarządza klastrem, koordynuje zadania i planuje prace

Węzły robocze

  • Wykonują zadania przydzielone przez węzeł główny
  • Odpowiadają za obliczenia i przechowywanie danych w pamięci lub na dysku

Węzeł główny

Węzeł roboczy

Wprowadzenie do PySpark

SparkSession

  • SparkSession umożliwia dostęp do klastra Spark i jest niezbędna do pracy z PySpark.
# Import SparkSession
from pyspark.sql import SparkSession

# Initialize a SparkSession
spark = SparkSession.builder.appName("MySparkApp").getOrCreate()

$$

  • .builder() konfiguruje sesję
  • getOrCreate() tworzy lub pobiera sesję
  • .appName() ułatwia zarządzanie wieloma sesjami
Wprowadzenie do PySpark

Ramki danych PySpark

  • Podobne do innych ramek danych, ale
  • Zoptymalizowane pod kątem PySpark
# Import and initialize a Spark session
from pyspark.sql import SparkSession
spark = SparkSession.builder.appName("MySparkApp").getOrCreate()

# Create a DataFrame
census_df = spark.read.csv("census.csv",
                ["gender","age","zipcode","salary_range_usd","marriage_status"])

# Show the DataFrame
census_df.show()

Wprowadzenie do PySpark

Czas na ćwiczenia!

Wprowadzenie do PySpark

Preparing Video For Download...