ประเภทของคลัสเตอร์และ Runtime
Introduction to Databricks Lakehouse
Gang Wang
Senior Data Scientist
คลัสเตอร์คืออะไร?
$$
กลุ่มของเครื่องเสมือน
สำหรับรันโค้ด
โหนด
Driver
หนึ่งตัวทำหน้าที่ประสานงาน
โหนด
Worker
หนึ่งตัวหรือมากกว่าทำการประมวลผล
คลัสเตอร์อ่านข้อมูลจาก Cloud Storage
$$
$$
All-Purpose Cluster
$$
พัฒนาแบบ
Interactive
และรัน ad-hoc query
แชร์
ใช้งานร่วมกันในทีม
ทำงานต่อเนื่องจนกว่าจะ
หยุดด้วยตนเอง
เปรียบได้กับรถส่วนตัว — พร้อมใช้เสมอ แต่มีค่าใช้จ่ายแม้ไม่ได้ใช้งาน
$$
Jobs Cluster
$$
สร้างขึ้น
อัตโนมัติ
เมื่องานเริ่มต้น
รัน
งานเดียว
แล้วหยุดทำงาน
ไม่ต้องจัดการด้วยตนเอง
ประหยัดค่าใช้จ่าย
สำหรับ Production Workload
$$
ควรใช้แบบไหนเมื่อใด?
$$
ข้อผิดพลาดที่พบบ่อย:
รัน Production Pipeline บน All-Purpose Cluster
Databricks Runtime
$$
Software Stack ที่มี Version
สำหรับรันบนทุกคลัสเตอร์
รวม Apache Spark, Delta Lake, Python, R, Scala
เวอร์ชัน
LTS
— Long-Term Support แนะนำสำหรับ Production
ML Runtime
มีไลบรารี ML ติดตั้งไว้ล่วงหน้า
$$
สรุป
$$
All-Purpose Cluster
— Interactive, แชร์ได้, จัดการด้วยตนเอง
Jobs Cluster
— อัตโนมัติ, รันงานเดียว, ประหยัดค่าใช้จ่าย
Databricks Runtime
— Software Stack ที่มี Version (ใช้ LTS สำหรับ Production)
เลือกประเภทคลัสเตอร์ให้ตรงกับ Workload เพื่อควบคุมค่าใช้จ่าย
มาฝึกกันเถอะ!
Introduction to Databricks Lakehouse
Preparing Video For Download...