データインテリジェンスプラットフォーム - コンピュート

Databricks入門

Kevin Barlow

Data Practitioner

なぜ組織はコンピュートを重視するのか?

単一の歯車

多数の歯車の仕組み

Databricks入門

Apache Spark

  • Databricks 共同創業者が開発
  • オープンソースのフレームワーク
  • 高効率な分散処理
  • Python、SQL、Scala、R の API
  • 幅広い用途に最適:
    • データエンジニアリング、機械学習、BI まで

DataCamp の Apache Spark コース をご覧ください。

Apache Spark ロゴ

Databricks入門

クラスターの種類

クラシック

  • コンピュート資源(仮想マシン)はコンピュートプレーンで作成
  • Databricks がクラウド側の設定を提供
  • 長所: コンピュートとセキュリティが自社環境内、既存のコンピュートプール活用など
  • 短所: 起動が遅い

Databricks コントロールプレーン

Databricks入門

クラスターの種類

サーバーレス

  • コンピュート資源(仮想マシン)はコントロールプレーンで作成
  • Databricks がユーザーにアクセスを提供
  • 長所: 起動が速い、最新機能、最高速の性能、継続的な性能向上
  • 短所(?): コンピュートが自社環境外

サーバーレスアーキテクチャ

Databricks入門

シングルノード vs. マルチノード

シングルノード

  • ドライバーノードのみのクラスター
  • Spark を実行可能
  • 単一ノードのフレームワーク(例: pandas)も実行可能
  • 小規模データに最適

シングルノードクラスター

マルチノード

  • ドライバーノードと1つ以上のワーカーノード
  • Spark が処理を複数ノードに分散
  • 大規模データに最適

マルチノードクラスター

Databricks入門

Databricks Runtime

  • すべての Databricks クラスターに搭載
    • 最適化版 Apache Spark
    • SQL を高速化する Photon
    • 共通ライブラリ(例: pandas、dplyr、scikit-learn)
    • Databricks サービス接続用ロジック

推奨: 最新の LTS(長期サポート)版 Runtime を使用

Databricks Runtime 搭載クラスター

Databricks入門

練習しましょう!

Databricks入門

Preparing Video For Download...