पुनरुत्पादनीय प्रयोग डिज़ाइन करना

प्रोडक्शन के लिए मशीन लर्निंग मॉडल विकसित करना

Sinan Ozdemir

Data Scientist and Author

पुनरुत्पादनीय प्रयोग

  • सटीकता और विश्वसनीयता सुनिश्चित करें.
  • नतीजों को दोहराना आसान.
  • बेहतर सहयोग संभव.
  • ML मॉडलों में पक्षपात का जोखिम घटाएँ.
  • शोध प्रक्रिया की अखंडता मज़बूत करें.
प्रोडक्शन के लिए मशीन लर्निंग मॉडल विकसित करना

MLflow

मशीन लर्निंग प्रयोगों को ट्रैक और मैनेज करने के लिए एक ओपन-सोर्स प्लेटफ़ॉर्म. MLflow का उपयोग करें:

  • पुनरुत्पादनीय ML पाइपलाइन बनाने के लिए
  • ट्रैक और मैनेज करने के लिए:
    • पैकेज डिपेंडेंसी
    • कोड वर्ज़न
    • प्रयोग सेटिंग्स
  • कई उपयोगकर्ताओं को प्रयोगों तक पहुँच देने के लिए

mlflow

1 https://www.databricks.com/blog/2018/06/05/introducing-mlflow-an-open-source-machine-learning-platform.html
प्रोडक्शन के लिए मशीन लर्निंग मॉडल विकसित करना

MLflow का उपयोग: उदाहरण

# standard scikit-learn imports
from sklearn.ensemble import RandomForestClassifier
from sklearn.model_selection import train_test_split
from sklearn.metrics import accuracy_score

# new imports from MLflow
import mlflow
import mlflow.sklearn
प्रोडक्शन के लिए मशीन लर्निंग मॉडल विकसित करना

MLflow का उपयोग: जारी

with mlflow.start_run():  # Start an MLflow run assuming we have data prepared

    # Build and train model
    rf = RandomForestClassifier()
    rf.fit(X_train, y_train)

    # Log parameters and model information
    mlflow.log_param("n_estimators", rf.n_estimators)
    mlflow.sklearn.log_model(rf, "model")

    y_pred = rf.predict(X_test)  # Evaluate model
    accuracy = accuracy_score(y_test, y_pred)
    mlflow.log_metric("accuracy", accuracy)  # log the test accuracy metric
प्रोडक्शन के लिए मशीन लर्निंग मॉडल विकसित करना

कोड ट्रैकिंग

  • MLflow से कोड वर्ज़न और बदलाव लॉग करना
  • कोड के अलग-अलग वर्ज़न की तुलना करना
  • किस कोड वर्ज़न से दिए गए नतीजे बने, पहचानना
  • प्रयोगों को आसानी से दोहराना
  • डिबग और ट्रबलशूट करना सरल बनाना
प्रोडक्शन के लिए मशीन लर्निंग मॉडल विकसित करना

मॉडल रजिस्ट्री

  • मॉडलों और उनके मेटाडेटा का केंद्रीकृत रिपॉज़िटरी
  • MLflow से मॉडल के अलग-अलग वर्ज़न लॉग, स्टोर और तुलना करें
  • पूरी ML पाइपलाइन को पुन:उत्पादित करें
  • मॉडलों की तुलना में उपयोग करें
  • मॉडलों की सटीकता और विश्वसनीयता सुनिश्चित करें

storage

प्रोडक्शन के लिए मशीन लर्निंग मॉडल विकसित करना

प्रयोगों की पुनरुत्पादनीयता

  • इनपुट डेटा, कोड, और सेटिंग्स को ट्रैक और लॉग करना
  • पूरी ML पाइपलाइन को पुन:उत्पादित करना
  • मशीन लर्निंग मॉडलों के नतीजों पर भरोसा बनाना
  • दूसरों को जाँचने और आगे बनाने देना
  • अलग-अलग रन में नतीजे एकसमान रखना

प्रोडक्शन के लिए मशीन लर्निंग मॉडल विकसित करना

डॉक्यूमेंटेशन पर फिर से नज़र

  • पुनरुत्पादनीय ML के लिए डॉक्यूमेंटेशन ज़रूरी है और इसमें यह शामिल होना चाहिए:
    • मॉडलों का इनपुट डेटा.
    • मॉडल बनाने में उपयोग किया गया कोड.
    • प्रयोग में उपयोग की गई कोई भी सेटिंग.
    • प्रयोग के नतीजे (कौन सा मॉडल चुना गया, आदि)
  • डॉक्यूमेंटेशन सुलभ होना चाहिए
  • यह पूरे प्रयोग का पूर्ण रिकॉर्ड हो
प्रोडक्शन के लिए मशीन लर्निंग मॉडल विकसित करना

अभ्यास करते हैं!

प्रोडक्शन के लिए मशीन लर्निंग मॉडल विकसित करना

Preparing Video For Download...