Опрацювання ознак у PySpark
John Hogue
Lead Data Scientist, General Mills
Обережно: Тут чудовиська


Конкретна версія (2.3.1)
Перевіряйте свої версії!
# return spark version
spark.version
# return python version
import sys
sys.version_info
Дані надаються у форматі Parquet

Методи PySpark read
# JSON
spark.read.json('example.json')
# CSV або розділені файли
spark.read.csv('example.csv')
# Parquet
spark.read.parquet('example.parq')
# Зчитати файл parquet до датафрейму PySpark
df = spark.read.parquet('example.parq')
Опрацювання ознак у PySpark