Wprowadzenie do PySpark
Benjamin Schmidt
Data Engineer
Wykorzystanie PySpark do uczenia maszynowego, zadań ETL i nie tylko
Entuzjastyczny nauczyciel nowych narzędzi!
-
Rozproszone przetwarzanie danych: przeznaczone do obsługi dużych zbiorów danych w klastrach
Obsługuje różne formaty danych, w tym CSV, Parquet i JSON
Integracja z SQL umożliwia zapytania w Pythonie i SQL
Zoptymalizowane pod kątem szybkości na dużą skalę

Analityka big data
Rozproszone przetwarzanie danych
Strumieniowanie danych w czasie rzeczywistym
Uczenie maszynowe na dużych zbiorach danych
Potoki ETL i ELT
Praca z różnorodnymi źródłami danych:


# Import SparkSession
from pyspark.sql import SparkSession
# Initialize a SparkSession
spark = SparkSession.builder.appName("MySparkApp").getOrCreate()
$$
.builder() konfiguruje sesjęgetOrCreate() tworzy lub pobiera sesję.appName() ułatwia zarządzanie wieloma sesjami# Import and initialize a Spark session
from pyspark.sql import SparkSession
spark = SparkSession.builder.appName("MySparkApp").getOrCreate()
# Create a DataFrame
census_df = spark.read.csv("census.csv",
["gender","age","zipcode","salary_range_usd","marriage_status"])
# Show the DataFrame
census_df.show()
Wprowadzenie do PySpark