Uniéndolo todo

Introducción a Databricks Lakehouse

Gang Wang

Senior Data Scientist

El escenario

$$

  • Eres ingeniero/a de datos y empiezas un proyecto nuevo en una empresa retail
  • Objetivo: configurar cómputo, verificar la canalización de datos, revisar gobernanza y preparar el despliegue

$$

recraft: half: Un/a ingeniero/a de datos en un escritorio moderno con un portátil que muestra una interfaz tipo Databricks, con diagramas de canalizaciones en una pizarra detrás, representando el onboarding a un nuevo proyecto de datos

Introducción a Databricks Lakehouse

Paso 1: Elige el cómputo adecuado

$$

  • La canalización se ejecuta cada noche con una programación
  • No se necesita desarrollo interactivo
  • Un jobs cluster con runtime LTS es lo adecuado
  • Activa autoescalado (2–6 workers) por volumen variable de datos

$$

All-Purpose Jobs Cluster
Modo Interactivo Automatizado
Gestión Manual Se apaga solo
Coste Mayor (tiempo inactivo) Optimizado en coste
Introducción a Databricks Lakehouse

Paso 2: Verifica la canalización medallion

$$

SELECT COUNT(*) FROM bronze_sales;
-- 1,247,832 rows

SELECT COUNT(*) FROM silver_sales;
-- 1,189,456 rows (nulls removed)

SELECT COUNT(*) FROM gold_daily_revenue;
-- 365 rows (daily aggregates)

$$

  • Bronze: datos en bruto, mayor número de filas
  • Silver: limpios, null y duplicados eliminados
  • Gold: agregados para informes de negocio
  • Las filas disminuyen a medida que sube la calidad
Introducción a Databricks Lakehouse

Paso 3: Revisa la gobernanza

$$

  • Ve a Unity Catalog e inspecciona la tabla gold_daily_revenue
  • Sigue el linaje hacia arriba y confirma que lee de silver_sales
  • Verifica los controles de acceso: solo el equipo de analítica tiene SELECT en gold
  • Confirma que Delta Sharing está configurado para el socio externo

$$

recraft: half: Una lupa sobre un grafo de linaje de datos con nodos de tablas conectados y marcas de verificación, representando la verificación de gobernanza

Introducción a Databricks Lakehouse

Paso 4: Prepárate para el despliegue

$$

  • Revisa el Asset Bundle databricks.yml
  • Confirma que el recurso del job nocturno está definido
  • Comprueba que el objetivo de producción apunta a la ruta correcta del workspace
  • Ejecuta bundle validate antes de desplegar

$$

targets:
  production:
    workspace:
      root_path: /Shared/production
resources:
  jobs:
    nightly_sales_etl:
      schedule:
        quartz_cron: "0 0 3 * * ?"
Introducción a Databricks Lakehouse

Resumen

$$

  • Cómputo: ajusta el tipo de clúster a la carga (jobs cluster para automatización)
  • Datos: verifica que las capas medallion fluyen correctamente
  • Gobernanza: linaje, accesos y compartición verificados
  • Despliegue: revisa el Asset Bundle, valida y despliega
Introducción a Databricks Lakehouse

¡Vamos a practicar!

Introducción a Databricks Lakehouse

Preparing Video For Download...