Por dónde empezar

Ingeniería de características con PySpark

John Hogue

Lead Data Scientist, General Mills

Zambullirse directo en el análisis

Aquí hay monstruos

  • Conviértete en tu propia persona experta
  • Define los objetivos del análisis
  • Investiga tus datos
  • Sé curioso/a, haz preguntas

Monstruos

Ingeniería de características con PySpark

El proceso de Data Science

Proceso de Data Science

Ingeniería de características con PySpark

Spark cambia rápido y a menudo

Ingeniería de características con PySpark

Formatos de datos: Parquet

Los datos se entregan como Parquet

  • Almacenado por columnas
    • Consultas rápidas de subconjuntos de columnas
  • Estructurado, esquema definido
    • Campos y tipos de datos definidos
    • Ideal para texto desordenado
  • Adoptado en la industria
    • ¡Buena habilidad que tener! 😃

Formato de archivo Parquet

Ingeniería de características con PySpark

Cargar los datos en Spark

Métodos read de PySpark

  • ¡PySpark admite muchos tipos de archivo!
# JSON
spark.read.json('example.json')
# CSV o archivos delimitados
spark.read.csv('example.csv')
# Parquet
spark.read.parquet('example.parq')
# Lee un archivo Parquet a un DataFrame de PySpark
df = spark.read.parquet('example.parq')
Ingeniería de características con PySpark

¡Vamos a practicar!

Ingeniería de características con PySpark

Preparing Video For Download...