Introduction to PySpark
Benjamin Schmidt
Data Engineer
Využití PySparku pro strojové učení, ETL úlohy a mnoho dalšího
Nadšený průvodce novými nástroji pro všechny!
-
Distribuované zpracování dat: navrženo pro velké datové sady napříč clustery
Podporuje různé formáty včetně CSV, Parquet a JSON
Integrace SQL umožňuje dotazování pomocí Pythonu i SQL
Optimalizováno pro rychlost ve velkém měřítku

Analytika velkých dat
Distribuované zpracování dat
Streamování dat v reálném čase
Strojové učení na velkých datových sadách
ETL a ELT pipeline
Práce s různorodými zdroji dat:


# Import SparkSession
from pyspark.sql import SparkSession
# Initialize a SparkSession
spark = SparkSession.builder.appName("MySparkApp").getOrCreate()
$$
.builder() nastaví relacigetOrCreate() vytvoří nebo načte relaci.appName() pomáhá spravovat více relací# Import and initialize a Spark session
from pyspark.sql import SparkSession
spark = SparkSession.builder.appName("MySparkApp").getOrCreate()
# Create a DataFrame
census_df = spark.read.csv("census.csv",
["gender","age","zipcode","salary_range_usd","marriage_status"])
# Show the DataFrame
census_df.show()
Introduction to PySpark