データ インテリジェンス プラットフォーム - コンピュート

統計学入門

Kevin Barlow

Data Practitioner

なぜ組織はコンピュートを重視するのでしょうか?

単一の歯車

歯車のシステム

統計学入門

Apache Spark

  • Databricksの共同創業者によって作成
  • オープンソースフレームワーク
  • 非常に効率的な分散コンピューティング
  • Python、SQL、Scala、R向けのAPI
  • あらゆるユースケースに最適:
    • データエンジニアリングから機械学習およびビジネスインテリジェンス

DataCampのApache Sparkコースをチェックしてみましょう!

Apache Sparkロゴ

統計学入門

クラスタの種類

クラシック

  • コンピュート リソース(仮想マシン)はコンピュート プレーンで作成されます
  • Databricks はクラウドに構成を提供します
  • 利点: お使いの環境でのコンピュートとセキュリティ、既存のコンピュートプールの活用など
  • 短所: 起動時間が遅い

Databricks コントロールプレーン

統計学入門

クラスタの種類

サーバーレス

  • コンピュートリソース(仮想マシン)はコントロールプレーンで作成されます
  • Databricks はユーザー{{2}}へのアクセスを提供します
  • 長所: 高速な起動時間、最新かつ最高の機能、最速のパフォーマンス、Databricks は時間の経過とともにパフォーマンスを向上させます
  • Cons(?): あなたの環境では計算できません

サーバーレスアーキテクチャ

統計学入門

単一ノード vs. マルチノード

シングルノード

  • ドライバーノード{{2}}を含むクラスター
  • Spark{{3}}は引き続き実行できます
  • 単一ノードのフレームワーク(例:pandas)も実行可能
  • 小規模データセットに最適

シングルノードクラスター

マルチノード

  • ドライバーノードと1つ以上のワーカーノードを含むクラスター
  • Sparkは複数のノードに作業を分散できます
  • 大規模データセットに最適

マルチノードクラスター

統計学入門

Databricks Runtime

  • すべての Databricks クラスターにインストール済み
    • Apache Spark {{2}} の最適化版
    • より高速なSQLクエリのためのPhoton
    • 一般的なライブラリ(例:pandas、dplyr、sci-kit learn)
    • Databricks サービスに接続するロジック

一般的な推奨事項: Runtime{{5}} の最新の長期サポート(LTS)版を使用してください

Databricks Runtime を備えたクラスター

統計学入門

練習しましょう!

統計学入門

Preparing Video For Download...