Küme türleri ve çalışma zamanları
Databricks Lakehouse'a Giriş
Gang Wang
Senior Data Scientist
Küme nedir?
$$
Kodunu çalıştıran bir
sanal makine grubu
Çalışmayı koordine eden bir
driver
düğümü
İşlemeyi yapan bir veya daha çok
worker
düğümü
Kümeler veriyi bulut depolamadan okur
$$
$$
Genel amaçlı kümeler
$$
Etkileşimli
geliştirme ve ad-hoc sorgular
Takımda birden çok kullanıcıyla
paylaşılır
Manuel
durdurana kadar çalışır
Kendi araban gibi düşün - hep hazır, ama park halindeyken de ücret yazıyor
$$
Job kümeleri
$$
Bir iş başladığında
otomatik
oluşturulur
Tek bir görevi
çalıştırır, sonra sonlanır
Manuel yönetim gerekmez
Üretim iş yükleri için
maliyet optimize
$$
Hangisini ne zaman kullanmalı?
$$
Yaygın hata:
üretim boru hatlarını genel amaçlı kümelerde çalıştırmak
Databricks Runtime
$$
Her kümeye kurulan
sürümlenmiş yazılım yığını
Apache Spark, Delta Lake, Python, R, Scala içerir
LTS
sürümler - uzun süreli destek; üretim için önerilir
ML Runtime
, ön yüklü ML kütüphaneleri ekler
$$
Özet
$$
Genel amaçlı kümeler
- etkileşimli, paylaşılan, manuel yönetilir
Job kümeleri
- otomatik, tek görev, maliyet optimize
Databricks Runtime
- sürümlenmiş yazılım yığını (üretimde LTS kullan)
Maliyeti kontrol için küme türünü iş yüküne uydur
Hadi pratik yapalım!
Databricks Lakehouse'a Giriş
Preparing Video For Download...