Začínáme s Databricks SQL

Databricks Concepts

Kevin Barlow

Data Practitioner

SQL Compute vs. obecný Compute

Návrh výpočetních clusterů pro datovou vědu nebo datové inženýrství...

import pyspark.sql.functions as F

spark_df = (spark
            .read
            .table('user_table'))

spark_df = (spark_df
            .withColumn('score', 
                        F.flatten(...))
           )

se zásadně liší od návrhu výpočetního výkonu pro SQL úlohy

SELECT *
FROM user_table u
LEFT JOIN product_use p
    ON u.userId = p.userId
WHERE country = 'USA'
AND utilization >= 0.6
Databricks Concepts

SQL Warehouse

Rozhraní SQL Warehouse

Databricks Concepts

SQL Warehouse

Možnosti konfigurace SQL Warehouse

  1. Název clusteru
  2. Velikost clusteru (S, M, L atd.)
  3. Chování škálování

Rozhraní SQL Warehouse – velikost clusteru

Databricks Concepts

SQL Warehouse

Možnosti konfigurace SQL Warehouse

  1. Název clusteru
  2. Velikost clusteru (S, M, L atd.)
  3. Chování škálování
  4. Typ clusteru

Rozhraní SQL Warehouse – typ clusteru

Databricks Concepts

Typy SQL Warehouse

Různé typy přinášejí různé výhody

Classic

  • Nejzákladnější SQL compute
  • V cloudu zákazníka

Pro

  • Pokročilejší funkce než Classic
  • V cloudu zákazníka

Serverless

  • Nejnovější funkce
  • V cloudu Databricks
  • Nejlepší poměr ceny a výkonu
Databricks Concepts

SQL Editor

SQL Editor

Databricks Concepts

Běžné SQL příkazy

COPY INTO

  • Načte surová data do Delta
  • Fáze Extract v ETL
COPY INTO my_table
FROM '/path/to/files'
FILEFORMAT = <format>
FORMAT_OPTIONS ('mergeSchema' = 'true')
COPY_OPTIONS ('mergeSchema' = 'true');

CREATE <entity> AS

  • Vytvoří tabulku nebo pohled
  • Fáze Transform v ETL
CREATE TABLE events
  USING DELTA
  AS (
      SELECT *
    FROM raw_events
    WHERE ...
  )
Databricks Concepts

Pojďme si procvičit!

Databricks Concepts

Preparing Video For Download...