З чого почати

Опрацювання ознак у PySpark

John Hogue

Lead Data Scientist, General Mills

Одразу пірнаємо в аналіз

Обережно: Тут чудовиська

  • Станьте власним експертом
  • Визначте цілі аналізу
  • Дослідіть свої дані
  • Будьте допитливі, ставте запитання

Чудовиська

Опрацювання ознак у PySpark

Процес Data Science

Процес Data Science

Опрацювання ознак у PySpark

Spark швидко й часто змінюється

Опрацювання ознак у PySpark

Формати даних: Parquet

Дані надаються у форматі Parquet

  • Зберігаються стовпцями
    • Швидкі запити підмножин стовпців
  • Структуровані, зі схемою
    • Поля й типи даних визначені
    • Чудово для неохайного тексту
  • Промисловий стандарт
    • Корисна навичка! 😃

Формат файлів Parquet

Опрацювання ознак у PySpark

Передавання даних у Spark

Методи PySpark read

  • PySpark підтримує багато типів файлів!
# JSON
spark.read.json('example.json')
# CSV або розділені файли
spark.read.csv('example.csv')
# Parquet
spark.read.parquet('example.parq')
# Зчитати файл parquet до датафрейму PySpark
df = spark.read.parquet('example.parq')
Опрацювання ознак у PySpark

Давайте потренуємось!

Опрацювання ознак у PySpark

Preparing Video For Download...