Confidentialité des données et anonymisation en Python
Rebeca Gonzalez
Data engineer
Des renseignements personnels non sensibles peuvent aussi être des quasi-identifiants.

Combinés à d'autres quasi-identifiants, ils deviennent identifiants.


Techniques d'anonymisation des quasi-identifiants pour réduire les risques de divulgation.

DataFrame d'origine
name phone
0 Cassandra Nelson 4399406975395
1 Brian Moss 0389407128613
2 Melody Gill 8283308773967
3 Sandra Huber 4366608954250
4 Patricia Webster 4466462475574
DataFrame avec les noms masqués
name phone
0 xxxx 4399406975395
1 xxxx 0389407128613
2 xxxx 8283308773967
3 xxxx 4366608954250
4 xxxx 4466462475574
Remplacer des valeurs sensibles par d'autres caractères comme « x » s'appelle aussi le masquage de données.
# Explorer le DataFrame
df.head()
country card_number email
0 Finland 3546746666030419 [email protected]
1 Belarus 4303032415762821 [email protected]
2 Turkmenistan 4536883671157 [email protected]
3 Puerto Rico 3568819286614160 [email protected]
4 Angola 2514167462583016 [email protected]
# Masquer uniformément la colonne des numéros de carte df['card_number'] = '****'# Voir le DataFrame obtenu df.head()
country card_number email
0 Finland **** [email protected]
1 Belarus **** [email protected]
2 Turkmenistan **** [email protected]
3 Puerto Rico **** [email protected]
4 Angola **** [email protected]

# Masquer le nom d'utilisateur du courriel df2['email'] = df2['email'].apply(lambda s: s[0] + '****' + s[s.find('@'):] )# Voir les données pseudonymisées obtenues df2.head()
country card_number email
0 Finland 3546746666030419 f****@gmail.com
1 Belarus 4303032415762821 m****@gmail.com
2 Turkmenistan 4536883671157 a****@gmail.com
3 Puerto Rico 3568819286614160 k****@gmail.com
4 Angola 2514167462583016 d****@gmail.com

# Importer la classe Faker from faker import Faker# Créer un générateur de fausses données fake_data = Faker()# Générer un numéro de carte de crédit fake_data.credit_card_number()
3542216874440804
# Masquer le numéro de carte avec de nouvelles données via une fonction lambda df['card_number'] = df['card_number'].apply(lambda x: fake_data.credit_card_number())# Voir les données pseudonymisées obtenues df.head()
country card_number email
0 Finland 3596625386355448 [email protected]
1 Belarus 376297265347524 [email protected]
2 Turkmenistan 4377494880888682 [email protected]
3 Puerto Rico 30553931809810 [email protected]
4 Angola 4241735748382 [email protected]
fake_data.name()
'Kelly Clark'
fake_data.name_male()
'Antonio Henderson'
fake_data.name_female()
'Jennifer Ortega'
Confidentialité des données et anonymisation en Python