Использование Databricks для машинного обучения

Концепции Databricks

Kevin Barlow

Data Practitioner

Жизненный цикл машинного обучения

Жизненный цикл машинного обучения

1 https://www.datacamp.com/blog/machine-learning-lifecycle-explained
Концепции Databricks

Планирование и подготовка

Жизненный цикл МО — разведочный анализ данных

Концепции Databricks

Планирование машинного обучения

Что у меня есть?

  1. Доступность данных
  2. Бизнес-требования
  3. Специалисты по данным и аналитики

Команда и ресурсы

Чего я хочу достичь?

  1. Варианты применения
  2. Соответствие правовым и требованиям безопасности
  3. Бизнес-результаты

Бизнес-результаты

Концепции Databricks

ML Runtime

  • Расширение вычислительной среды Databricks
  • Оптимизирован для задач машинного обучения
  • Включает наиболее популярные библиотеки и фреймворки
    • scikit-learn, SparkML, TensorFlow
    • MLFlow
  • Работает с управлением библиотеками кластера

Databricks ML Runtime

Концепции Databricks

Разведочный анализ данных

import pandas as pd
pd.describe(df)
# Spark DF
df.summary()
dbutils.data.summarize()
import bamboolib as bam
df

Разведочный анализ данных в Databricks

Концепции Databricks

Таблицы признаков и хранилища признаков

Исходные данные
count category price shelf_loc rating
4 horror 12.50 end 3
6 romance 13.99 top 4.5
12 sci-fi 16.50 bottom 5
31 romance 9.99 bottom 3.5
23 fantasy 24.99 top 4
18 horror 19.99 end 2.5
19 cooking 17.50 end 4.5
7 fantasy 12.99 top 3
37 sci-fi 14.99 bottom 5
Таблица признаков
count category price shelf_loc rating
4 1 12.50 1 3
6 2 13.99 2 4.5
12 3 16.50 3 5
31 2 9.99 3 3.5
23 4 24.99 2 4
18 1 19.99 1 2.5
19 5 17.50 1 4.5
7 4 12.99 2 3
37 3 14.99 3 5
Концепции Databricks

Databricks Feature Store

  • Централизованное хранилище наборов данных с признаками
  • Удобный поиск и повторное использование признаков для моделей МО
  • Отслеживание зависимостей вверх и вниз по потоку

Databricks Feature Store

from databricks import feature_store

fs = feature_store.FeatureStoreClient()

fs.create_table(
    name=table_name,
    primary_keys=["wine_id"],
    df=features_df,
    schema=features_df.schema,
    description="wine features"
)
Концепции Databricks

Давайте потренируемся!

Концепции Databricks

Preparing Video For Download...