Bắt đầu với Databricks SQL

Các khái niệm về Databricks

Kevin Barlow

Data Practitioner

SQL Compute so với Compute tổng quát

Thiết kế cụm compute cho công việc khoa học dữ liệu/kỹ thuật dữ liệu...

import pyspark.sql.functions as F

spark_df = (spark
            .read
            .table('user_table'))

spark_df = (spark_df
            .withColumn('score', 
                        F.flatten(...))
           )

vốn khác với thiết kế compute cho tác vụ SQL

SELECT *
FROM user_table u
LEFT JOIN product_use p
    ON u.userId = p.userId
WHERE country = 'USA'
AND utilization >= 0.6
Các khái niệm về Databricks

SQL Warehouse

Giao diện SQL Warehouse

Các khái niệm về Databricks

SQL Warehouse

Tùy chọn cấu hình SQL Warehouse

  1. Tên cụm
  2. Kích thước cụm (S, M, L, v.v.)
  3. Hành vi mở rộng

Giao diện SQL Warehouse - Kích thước cụm

Các khái niệm về Databricks

SQL Warehouse

Tùy chọn cấu hình SQL Warehouse

  1. Tên cụm
  2. Kích thước cụm (S, M, L, v.v.)
  3. Hành vi mở rộng
  4. Loại cụm

Giao diện SQL Warehouse - Loại cụm

Các khái niệm về Databricks

Các loại SQL Warehouse

Các loại khác nhau mang lại lợi ích khác nhau

Classic

  • SQL compute cơ bản nhất
  • Chạy trong cloud của khách hàng

Pro

  • Nhiều tính năng hơn Classic
  • Chạy trong cloud của khách hàng

Serverless

  • Tính năng tiên tiến nhất
  • Chạy trong cloud của Databricks
  • Hiệu quả chi phí nhất
Các khái niệm về Databricks

Trình soạn thảo SQL

Trình soạn thảo SQL

Các khái niệm về Databricks

Các lệnh SQL thường dùng

COPY INTO

  • Lấy dữ liệu thô và đưa vào Delta
  • Pha Extract của ETL
COPY INTO my_table
FROM '/path/to/files'
FILEFORMAT = <format>
FORMAT_OPTIONS ('mergeSchema' = 'true')
COPY_OPTIONS ('mergeSchema' = 'true');

CREATE <entity> AS

  • Tạo Table hoặc View
  • Pha Transform trong ETL
CREATE TABLE events
  USING DELTA
  AS (
      SELECT *
    FROM raw_events
    WHERE ...
  )
Các khái niệm về Databricks

Passons à la pratique !

Các khái niệm về Databricks

Preparing Video For Download...