Начало работы с Databricks SQL

Концепции Databricks

Kevin Barlow

Data Practitioner

SQL Compute и General Compute

Проектирование вычислительных кластеров для задач Data Science или инженерии данных...

import pyspark.sql.functions as F

spark_df = (spark
            .read
            .table('user_table'))

spark_df = (spark_df
            .withColumn('score', 
                        F.flatten(...))
           )

принципиально отличается от проектирования вычислений для SQL-нагрузок

SELECT *
FROM user_table u
LEFT JOIN product_use p
    ON u.userId = p.userId
WHERE country = 'USA'
AND utilization >= 0.6
Концепции Databricks

SQL Warehouse

Интерфейс SQL Warehouse

Концепции Databricks

SQL Warehouse

Параметры конфигурации SQL Warehouse

  1. Имя кластера
  2. Размер кластера (S, M, L и др.)
  3. Поведение масштабирования

Интерфейс SQL Warehouse — размер кластера

Концепции Databricks

SQL Warehouse

Параметры конфигурации SQL Warehouse

  1. Имя кластера
  2. Размер кластера (S, M, L и др.)
  3. Поведение масштабирования
  4. Тип кластера

Интерфейс SQL Warehouse — тип кластера

Концепции Databricks

Типы SQL Warehouse

Каждый тип предоставляет разные преимущества

Classic

  • Базовый SQL compute
  • В облаке клиента

Pro

  • Расширенные возможности по сравнению с Classic
  • В облаке клиента

Serverless

  • Передовые функции
  • В облаке Databricks
  • Оптимальное соотношение цены и производительности
Концепции Databricks

Редактор SQL

Редактор SQL

Концепции Databricks

Основные команды SQL

COPY INTO

  • Загрузка сырых данных в Delta
  • Этап Extract в ETL
COPY INTO my_table
FROM '/path/to/files'
FILEFORMAT = <format>
FORMAT_OPTIONS ('mergeSchema' = 'true')
COPY_OPTIONS ('mergeSchema' = 'true');

CREATE <entity> AS

  • Создание таблицы или представления
  • Этап Transform в ETL
CREATE TABLE events
  USING DELTA
  AS (
      SELECT *
    FROM raw_events
    WHERE ...
  )
Концепции Databricks

Давайте потренируемся!

Концепции Databricks

Preparing Video For Download...