Fuzja danych

Projektowanie przepływów pracy uczenia maszynowego w Pythonie

Dr. Chris Anagnostopoulos

Honorary Associate Professor

Komputery, porty i protokoły

Ruch komputerowy jest przesyłany w pakietach z portu komputera źródłowego do portu komputera docelowego.

Projektowanie przepływów pracy uczenia maszynowego w Pythonie

Zbiór danych LANL cyber

flows: Przepływy to sesje ciągłego transferu danych między portem komputera źródłowego a portem komputera docelowego, zgodnie z określonym protokołem.

flows.iloc[1]
time                    471692
duration                     0
source_computer          C5808
source_port              N2414
destination_computer    C26871
destination_port        N19148
protocol                     6
packet_count                 1
byte_count                  60
1 https://csr.lanl.gov/data/cyber1/
Projektowanie przepływów pracy uczenia maszynowego w Pythonie

Zbiór danych LANL cyber

attack: informacje o atakach przeprowadzonych przez zespół bezpieczeństwa podczas testów.

attacks.head()
     time user@domain source_computer destination_computer
0  151036   U748@DOM1          C17693                 C305
1  151648   U748@DOM1          C17693                 C728
2  151993  U6115@DOM1          C17693                C1173
3  153792   U636@DOM1          C17693                 C294
4  155219   U748@DOM1          C17693                C5693

Jak możemy konstruować etykietowane przykłady z tych danych?

1 https://csr.lanl.gov/data/cyber1/
Projektowanie przepływów pracy uczenia maszynowego w Pythonie

Etykietowanie zdarzeń a etykietowanie komputerów

Pojedyncze zdarzenie trudno jest etykietować. Pojedyncza transakcja między zainfekowanym komputerem źródłowym a komputerem docelowym.

Natomiast cały komputer jest albo zainfekowany, albo nie. Zainfekowane źródło próbuje komunikować się ze wszystkimi możliwymi portami na dwóch różnych komputerach.

Projektowanie przepływów pracy uczenia maszynowego w Pythonie

Grupowanie i ekstrakcja cech

Jednostka analizy = destination_computer

flows_grouped = flows.groupby('destination_computer')

list(flows_grouped)[0]
('C10047',         
        time  duration    ...     packet_count byte_count
2791  471694         0    ...               12       6988
2792  471694         0    ...                1        193
...
2846  471694        38    ...              157      84120
Projektowanie przepływów pracy uczenia maszynowego w Pythonie

Grupowanie i ekstrakcja cech

Z jednego DataFrame na komputer do jednego wektora cech na komputer.

def featurize(df):
    return {
        'unique_ports': len(set(df['destination_port'])),
        'average_packet': np.mean(df['packet_count']),
        'average_duration': np.mean(df['duration'])
    }
Projektowanie przepływów pracy uczenia maszynowego w Pythonie

Grupowanie i ekstrakcja cech

out = flows.groupby('destination_computer').apply(featurize)
X = pd.DataFrame(list(out), index=out.index)

X.head()
                      average_duration      ...       unique_ports
destination_computer                        ...                   
C10047                        7.538462      ...                 13
C10054                        0.000000      ...                  1
C10131                       55.000000      ...                  1
...
[5 rows x 3 columns]
Projektowanie przepływów pracy uczenia maszynowego w Pythonie

Etykietowany zbiór danych

bads = set(attacks['source_computer'].append(attacks['destination_computer']))
y = [x in bads for x in X.index]

Para (X, y) tworzy teraz standardowy, etykietowany zbiór danych do klasyfikacji.

X_train, X_test, y_train, y_test = train_test_split(X, y)
clf = AdaBoostClassifier()
accuracy_score(y_test, clf.fit(X_train, y_train).predict(X_test))
0.92
Projektowanie przepływów pracy uczenia maszynowego w Pythonie

Gotowy, aby złapać hakera?

Projektowanie przepływów pracy uczenia maszynowego w Pythonie

Preparing Video For Download...