Tipos de clúster y runtimes

Introducción a Databricks Lakehouse

Gang Wang

Senior Data Scientist

¿Qué es un clúster?

$$

  • Un conjunto de máquinas virtuales que ejecutan tu código
  • Un nodo driver coordina el trabajo
  • Uno o varios nodos worker hacen el procesamiento
  • Los clústeres leen datos del almacenamiento en la nube

$$

$$

jerarquía: Nodo Driver, Worker 1, Worker 2, Worker 3, Almacenamiento en la nube

Introducción a Databricks Lakehouse

Clústeres de uso general

$$

  • Desarrollo interactivo y consultas ad hoc
  • Compartido por varias personas del equipo
  • Sigue activo hasta que lo detienes manualmente
  • Piénsalo como tu coche personal: siempre disponible, pero pagas incluso parado

$$

recraft: half: Un coche particular aparcado en una entrada, siempre disponible pero con coste incluso en reposo; representa un recurso de cómputo siempre activo

Introducción a Databricks Lakehouse

Clústeres de jobs

$$

  • Se crean automáticamente al iniciar un job
  • Ejecutan una tarea única y luego terminan
  • No requieren gestión manual
  • Optimizados en coste para producción

$$

recraft: half: Un taxi moderno con un taxímetro iluminado arriba, representa un recurso de cómputo bajo demanda que se inicia y se detiene automáticamente

Introducción a Databricks Lakehouse

¿Cuándo usar cada uno?

$$

comparación: Uso general, Dev interactivo, Trabajo en notebooks, SQL ad hoc, Uso en equipo | Jobs, ETL nocturno, Informes programados, Tests automáticos, Producción

  • Error común: ejecutar pipelines de producción en clústeres de uso general
Introducción a Databricks Lakehouse

Databricks Runtime

$$

  • Pila de software versionada que se ejecuta en cada clúster
  • Incluye Apache Spark, Delta Lake, Python, R, Scala
  • Versiones LTS (soporte a largo plazo), recomendadas para producción
  • ML Runtime añade bibliotecas de ML preinstaladas

$$

capas: Runtime 15.4 LTS, Apache Spark 3.5.x, Delta Lake 3.2.x, Python 3.11 / Scala 2.12 / R 4.3, Bibliotecas del sistema

Introducción a Databricks Lakehouse

Resumen

$$

  • Clústeres de uso general: interactivos, compartidos, gestión manual
  • Clústeres de jobs: automatizados, tarea única, optimizados en coste
  • Databricks Runtime: pila de software versionada (usa LTS en producción)
  • Ajusta el tipo de clúster a la carga de trabajo para controlar costes
Introducción a Databricks Lakehouse

¡Vamos a practicar!

Introducción a Databricks Lakehouse

Preparing Video For Download...