Wdrożenie modelu

Projektowanie przepływów pracy uczenia maszynowego w Pythonie

Dr. Chris Anagnostopoulos

Honorary Associate Professor

Obiekt pipeline zawierający selekcję cech, wybór modelu, strojenie i dopasowanie jest przesyłany do środowiska produkcyjnego, gdzie służy do predykcji.

Projektowanie przepływów pracy uczenia maszynowego w Pythonie

Serializacja modelu

Zapisz klasyfikator do pliku:

import pickle
clf = RandomForestClassifier().fit(X_train, y_train)
with open('model.pkl', 'wb') as file:
    pickle.dump(clf, file=file)

Wczytaj go ponownie z pliku:

with open('model.pkl', 'rb') as file:
    clf2 = pickle.load(file)
Projektowanie przepływów pracy uczenia maszynowego w Pythonie

Serializacja pipeline'u

Środowisko deweloperskie:

vt = SelectKBest(f_classif).fit(
    X_train, y_train)
clf = RandomForestClassifier().fit(
    vt.transform(X_train), y_train)
with open('vt.pkl', 'wb') as file: 
     pickle.dump(vt)
with open('clf.pkl', 'wb') as file: 
     pickle.dump(clf)

Przepływ pracy, w którym obiekt selekcji cech i dopasowany model są przesyłane do produkcji osobno.

Projektowanie przepływów pracy uczenia maszynowego w Pythonie

Serializacja pipeline'u

Środowisko produkcyjne:

with open('vt.pkl', 'rb') as file: 
    vt = pickle.load(vt)
with open('clf.pkl', 'rb') as file: 
    clf = pickle.load(clf)
clf.predict(vt.transform(X_new))

Przepływ pracy, w którym obiekt selekcji cech i dopasowany model są przesyłane do produkcji osobno.

Projektowanie przepływów pracy uczenia maszynowego w Pythonie

Serializacja pipeline'u

Środowisko deweloperskie:

pipe = Pipeline([
    ('fs', SelectKBest(f_classif)), 
    ('clf', RandomForestClassifier())
])
params = dict(fs__k=[2, 3, 4],
    clf__max_depth=[5, 10, 20])
gs = GridSearchCV(pipe, params)
gs = gs.fit(X_train, y_train)

with open('pipe.pkl', 'wb') as file: pickle.dump(gs, file)

Zoptymalizowany przepływ pracy, w którym selekcja cech i dopasowanie modelu są zawarte w jednym obiekcie pipeline.

Projektowanie przepływów pracy uczenia maszynowego w Pythonie

Serializacja pipeline'u

Środowisko produkcyjne:

with open('pipe.pkl', 'rb') as file:
   gs = pickle.dump(gs, file)
gs.predict(X_test)

Zoptymalizowany przepływ pracy, w którym selekcja cech i dopasowanie modelu są zawarte w jednym obiekcie pipeline.

Projektowanie przepływów pracy uczenia maszynowego w Pythonie

Niestandardowe transformacje cech

   checking_status  duration       ...        own_telephone  foreign_worker
0                1         6       ...                    1               1
1                0        48       ...                    0               1
def negate_second_column(X):
    Z = X.copy()
    Z[:,1] = -Z[:,1]
    return Z
pipe = Pipeline([('ft', FunctionTransformer(negate_second_column)), 
    ('clf', RandomForestClassifier())])
Projektowanie przepływów pracy uczenia maszynowego w Pythonie

Gotowy do produkcji!

Projektowanie przepływów pracy uczenia maszynowego w Pythonie

Preparing Video For Download...