機械学習における Databricks の活用

Databricks の基本概念

Kevin Barlow

Data Practitioner

機械学習ライフサイクル

機械学習ライフサイクル

1 https://www.datacamp.com/blog/machine-learning-lifecycle-explained
Databricks の基本概念

計画と準備

ML ライフサイクル - EDA

Databricks の基本概念

機械学習の計画

何があるか

  1. データの有無
  2. ビジネス要件
  3. データサイエンティスト/アナリスト

データチームとリソース

何を目指すか

  1. ユースケース
  2. 法務・セキュリティ遵守
  3. 事業成果

ビジネス成果

Databricks の基本概念

ML ランタイム

  • Databricks コンピュートの拡張
  • 機械学習向けに最適化
  • 主要ライブラリとフレームワークを同梱
    • scikit-learnSparkMLTensorFlow
    • MLFlow
  • クラスターのライブラリ管理に対応

Databricks ML Runtime

Databricks の基本概念

探索的データ分析(EDA)

import pandas as pd
pd.describe(df)
# Spark DF
df.summary()
dbutils.data.summarize()
import bamboolib as bam
df

Databricks での EDA

Databricks の基本概念

特徴量テーブルとフィーチャーストア

生データ
count category price shelf_loc rating
4 horror 12.50 end 3
6 romance 13.99 top 4.5
12 sci-fi 16.50 bottom 5
31 romance 9.99 bottom 3.5
23 fantasy 24.99 top 4
18 horror 19.99 end 2.5
19 cooking 17.50 end 4.5
7 fantasy 12.99 top 3
37 sci-fi 14.99 bottom 5
特徴量テーブル
count category price shelf_loc rating
4 1 12.50 1 3
6 2 13.99 2 4.5
12 3 16.50 3 5
31 2 9.99 3 3.5
23 4 24.99 2 4
18 1 19.99 1 2.5
19 5 17.50 1 4.5
7 4 12.99 2 3
37 3 14.99 3 5
Databricks の基本概念

Databricks フィーチャーストア

  • 特徴量化データセットの集中管理
  • 機械学習モデル向け特徴量を容易に発見・再利用
  • 上流・下流のリネージ

Databricks フィーチャーストア

from databricks import feature_store

fs = feature_store.FeatureStoreClient()

fs.create_table(
    name=table_name,
    primary_keys=["wine_id"],
    df=features_df,
    schema=features_df.schema,
    description="wine features"
)
Databricks の基本概念

¡Vamos a practicar!

Databricks の基本概念

Preparing Video For Download...