Maskowanie danych i generowanie danych z Faker

Prywatność danych i anonimizacja w Pythonie

Rebeca Gonzalez

Data engineer

Quasi-identyfikatory

Niewrażliwe dane osobowe mogą być również quasi-identyfikatorami. Tekst „Szef rządu w Europie" i data urodzenia ze strzałkami wskazującymi twarz Angeli Merkel

1 Zdjęcie Angeli Merkel z Wikimedia Commons
Prywatność danych i anonimizacja w Pythonie

Quasi-identyfikatory

W połączeniu z innymi quasi-identyfikatorami stają się identyfikujące.

  • Wiek
  • Płeć
  • Zawód
  • Daty osobiste: urodzenia, śmierci, przyjęcia do placówki medycznej, wizyty itp.

Rysunek mężczyzny z wyskakującymi okienkami zawierającymi dane osobowe

Prywatność danych i anonimizacja w Pythonie

Quasi-identyfikatory i ataki re-identyfikacyjne

Diagram przedstawiający część wspólną dwóch zbiorów danych: danych medycznych i listy wyborców, gdzie częścią wspólną są kod pocztowy, data urodzenia i płeć

Prywatność danych i anonimizacja w Pythonie

Więcej technik anonimizacji

Techniki anonimizacji quasi-identyfikatorów w celu zmniejszenia ryzyka ujawnienia danych. Dwie tabele z danymi medycznymi i osobowymi. Po lewej dane oryginalne, po prawej zbiór danych z usuniętym atrybutem imienia i nazwiska

Prywatność danych i anonimizacja w Pythonie

Maskowanie danych

Oryginalny DataFrame

     name                phone
0    Cassandra Nelson    4399406975395
1    Brian Moss          0389407128613
2    Melody Gill         8283308773967
3    Sandra Huber        4366608954250
4    Patricia Webster    4466462475574

DataFrame z zamaskowanymi imionami

     name    phone
0    xxxx    4399406975395
1    xxxx    0389407128613
2    xxxx    8283308773967
3    xxxx    4366608954250
4    xxxx    4466462475574

Zastępowanie wrażliwych wartości innymi znakami, np. „x", nazywa się maskowaniem danych.

Prywatność danych i anonimizacja w Pythonie

Maskowanie danych

# Explore the DataFrame
df.head()
     country         card_number           email
0    Finland         3546746666030419      [email protected]
1    Belarus         4303032415762821      [email protected]
2    Turkmenistan    4536883671157         [email protected]
3    Puerto Rico     3568819286614160      [email protected]
4    Angola          2514167462583016      [email protected]
Prywatność danych i anonimizacja w Pythonie

Maskowanie danych

# Uniformly mask the card number colum 
df['card_number'] = '****'


# See resulting DataFrame df.head()
     country         card_number     email
0    Finland         ****            [email protected]
1    Belarus         ****            [email protected]
2    Turkmenistan    ****            [email protected]
3    Puerto Rico     ****            [email protected]
4    Angola          ****            [email protected]
Prywatność danych i anonimizacja w Pythonie

Częściowe maskowanie danych

Zrzut ekranu sekcji resetowania hasła na Facebooku z częściowo zamaskowanym adresem e-mail

Prywatność danych i anonimizacja w Pythonie

Częściowe maskowanie danych

# Mask username from email
df2['email'] = df2['email'].apply(lambda s: s[0] + '****' + s[s.find('@'):] )


# See the resulting pseudonymized data df2.head()
     country         card_number           email
0    Finland         3546746666030419      f****@gmail.com
1    Belarus         4303032415762821      m****@gmail.com
2    Turkmenistan    4536883671157         a****@gmail.com
3    Puerto Rico     3568819286614160      k****@gmail.com
4    Angola          2514167462583016      d****@gmail.com
Prywatność danych i anonimizacja w Pythonie

Generowanie danych syntetycznych

Po lewej tabela z oryginalnymi numerami kart, po prawej syntetycznie wygenerowane nowe numery kart kredytowych.

  • Zastępowanie wrażliwych danych nowo wygenerowanymi, podobnymi do oryginalnych.
Prywatność danych i anonimizacja w Pythonie

Generowanie danych syntetycznych

# Import Faker class
from faker import Faker


# Create fake data generator fake_data = Faker()
# Generate a credit card number fake_data.credit_card_number()
3542216874440804
Prywatność danych i anonimizacja w Pythonie

Generowanie danych syntetycznych

# Mask card number with new generated data using a lambda function
df['card_number'] = df['card_number'].apply(lambda x: fake_data.credit_card_number())

# See the resulting pseudonymized data df.head()
     country         card_number            email
0    Finland         3596625386355448       [email protected]
1    Belarus         376297265347524        [email protected]
2    Turkmenistan    4377494880888682       [email protected]
3    Puerto Rico     30553931809810         [email protected]
4    Angola          4241735748382          [email protected]
Prywatność danych i anonimizacja w Pythonie

Generowanie innych typów danych

fake_data.name()
'Kelly Clark'
fake_data.name_male()
'Antonio Henderson'
fake_data.name_female()
'Jennifer Ortega'
Prywatność danych i anonimizacja w Pythonie

Czas na ćwiczenia!

Prywatność danych i anonimizacja w Pythonie

Preparing Video For Download...