Databricks SQL ile başlarken

Databricks Kavramları

Kevin Barlow

Data Practitioner

SQL Compute ve Genel Compute

Veri bilimi ya da veri mühendisliği iş yükleri için bilgi işlem kümeleri tasarlamak...

import pyspark.sql.functions as F

spark_df = (spark
            .read
            .table('user_table'))

spark_df = (spark_df
            .withColumn('score', 
                        F.flatten(...))
           )

SQL iş yükleri için bilgi işlem tasarlamaktan temelde farklıdır

SELECT *
FROM user_table u
LEFT JOIN product_use p
    ON u.userId = p.userId
WHERE country = 'USA'
AND utilization >= 0.6
Databricks Kavramları

SQL Warehouse

SQL Warehouse arayüzü

Databricks Kavramları

SQL Warehouse

SQL Warehouse Yapılandırma Seçenekleri

  1. Küme Adı
  2. Küme Boyutu (S, M, L, vb.)
  3. Ölçekleme davranışı

SQL Warehouse arayüzü - Küme Boyutu

Databricks Kavramları

SQL Warehouse

SQL Warehouse Yapılandırma Seçenekleri

  1. Küme Adı
  2. Küme Boyutu (S, M, L, vb.)
  3. Ölçekleme davranışı
  4. Küme Türü

SQL Warehouse arayüzü - Küme Türü

Databricks Kavramları

SQL Warehouse Türleri

Farklı türler farklı avantajlar sunar

Classic

  • En temel SQL compute
  • Müşteri bulutunda

Pro

  • Classic'ten daha gelişmiş özellikler
  • Müşteri bulutunda

Serverless

  • En yeni özellikler
  • Databricks bulutunda
  • En maliyet etkin
Databricks Kavramları

SQL Editörü

SQL Editörü

Databricks Kavramları

Yaygın SQL Komutları

COPY INTO

  • Ham veriyi alıp Delta'ya koyar
  • ETL'in Extract aşaması
COPY INTO my_table
FROM '/path/to/files'
FILEFORMAT = <format>
FORMAT_OPTIONS ('mergeSchema' = 'true')
COPY_OPTIONS ('mergeSchema' = 'true');

CREATE <entity> AS

  • Tablo veya View oluştur
  • ETL'in Transform aşaması
CREATE TABLE events
  USING DELTA
  AS (
      SELECT *
    FROM raw_events
    WHERE ...
  )
Databricks Kavramları

Hadi pratik yapalım!

Databricks Kavramları

Preparing Video For Download...