Databricks SQL の概要

Databricks の基本概念

Kevin Barlow

Data Practitioner

SQL コンピュート vs. 汎用コンピュート

データサイエンス/データエンジニアリング向けのコンピュート設計は…

import pyspark.sql.functions as F

spark_df = (spark
            .read
            .table('user_table'))

spark_df = (spark_df
            .withColumn('score', 
                        F.flatten(...))
           )

SQL ワークロード向けの設計とは本質的に異なります

SELECT *
FROM user_table u
LEFT JOIN product_use p
    ON u.userId = p.userId
WHERE country = 'USA'
AND utilization >= 0.6
Databricks の基本概念

SQL Warehouse

SQL Warehouse UI

Databricks の基本概念

SQL Warehouse

SQL Warehouse の設定項目

  1. クラスター名
  2. クラスターサイズ(S, M, L など)
  3. スケーリング動作

SQL Warehouse UI - Cluster Size

Databricks の基本概念

SQL Warehouse

SQL Warehouse の設定項目

  1. クラスター名
  2. クラスターサイズ(S, M, L など)
  3. スケーリング動作
  4. クラスタ―タイプ

SQL Warehouse UI - Cluster Type

Databricks の基本概念

SQL Warehouse の種類

種類ごとに利点が異なる

Classic

  • 最も基本的な SQL コンピュート
  • お客様のクラウド上

Pro

  • Classic より高機能
  • お客様のクラウド上

Serverless

  • 先進機能
  • Databricks のクラウド上
  • 最も高い費用対効果
Databricks の基本概念

SQL エディタ

SQL エディタ

Databricks の基本概念

一般的な SQL コマンド

COPY INTO

  • 生データを取得して Delta に格納
  • ETL の Extract
COPY INTO my_table
FROM '/path/to/files'
FILEFORMAT = <format>
FORMAT_OPTIONS ('mergeSchema' = 'true')
COPY_OPTIONS ('mergeSchema' = 'true');

CREATE <entity> AS

  • テーブルまたはビューを作成
  • ETL の Transform
CREATE TABLE events
  USING DELTA
  AS (
      SELECT *
    FROM raw_events
    WHERE ...
  )
Databricks の基本概念

演習に進みましょう!

Databricks の基本概念

Preparing Video For Download...