Tipos de clúster y runtimes
Introducción a Databricks Lakehouse
Gang Wang
Senior Data Scientist
¿Qué es un clúster?
$$
Un
conjunto de máquinas virtuales
que ejecutan tu código
Un nodo
driver
coordina el trabajo
Uno o varios nodos
worker
hacen el procesamiento
Los clústeres leen datos del almacenamiento en la nube
$$
$$
Clústeres de uso general
$$
Desarrollo
interactivo
y consultas ad hoc
Compartido
por varias personas del equipo
Sigue activo hasta que lo detienes
manualmente
Piénsalo como tu coche personal: siempre disponible, pero pagas incluso parado
$$
Clústeres de jobs
$$
Se crean
automáticamente
al iniciar un job
Ejecutan una
tarea única
y luego terminan
No requieren gestión manual
Optimizados en coste
para producción
$$
¿Cuándo usar cada uno?
$$
Error común:
ejecutar pipelines de producción en clústeres de uso general
Databricks Runtime
$$
Pila de software versionada
que se ejecuta en cada clúster
Incluye Apache Spark, Delta Lake, Python, R, Scala
Versiones
LTS
(soporte a largo plazo), recomendadas para producción
ML Runtime
añade bibliotecas de ML preinstaladas
$$
Resumen
$$
Clústeres de uso general
: interactivos, compartidos, gestión manual
Clústeres de jobs
: automatizados, tarea única, optimizados en coste
Databricks Runtime
: pila de software versionada (usa LTS en producción)
Ajusta el tipo de clúster a la carga de trabajo para controlar costes
¡Vamos a practicar!
Introducción a Databricks Lakehouse
Preparing Video For Download...