Vytváření syntetických datových sad pomocí scikit-learn

Ochrana soukromí a anonymizace dat v Pythonu

Rebeca Gonzalez

Data engineer

Generování datových sad pomocí Scikit-learn

  • Můžeme vytvářet datové sady vzorkováním z pravděpodobnostních rozdělení

  • Například z normálního rozdělení

Histogram zobrazující normální rozdělení

Ochrana soukromí a anonymizace dat v Pythonu

Normální rozdělení

Běžně se vyskytují v přírodě

  • Výška
  • Krevní tlak
  • IQ skóre

Histogram hodnot výšky z velkého souboru dat s normálním rozdělením

Ochrana soukromí a anonymizace dat v Pythonu

Vzorkování z normálního rozdělení

import numpy as np


# Create new pandas DataFrame new_measures = pd.DataFrame()
# Selecting the mean/center values and the standard deviation of the sample mean = 65 standard_deviation = 2
# Generating the sample new_measures['Height'] = np.random.normal(mean, standard_deviation, 10000)
Ochrana soukromí a anonymizace dat v Pythonu

Vzorkování z normálního rozdělení

# Draw histogram to see the resulting heights distribution
new_measures['Height'].hist(bins=50)

Histogram výsledných dat

Ochrana soukromí a anonymizace dat v Pythonu

Vytváření datových sad pomocí scikit-learn

Scikit-learn nabízí jednoduché funkce pro generování datových sad pro:

  • Klasifikaci
  • Shlukování
  • Regresi
Ochrana soukromí a anonymizace dat v Pythonu

Syntetická data pro klasifikaci a shlukování

make_classification()

  • Rozmísťuje normálně rozložené shluky bodů
  • Umožňuje vytvářet korelované a neinformativní příznaky

make_blobs()

  • Větší kontrola nad středy a směrodatnými odchylkami shluků
Ochrana soukromí a anonymizace dat v Pythonu

Syntetická data pro klasifikaci

# Import make_classification from sklearn datasets module
from sklearn.datasets import make_classification


# Generate the samples and their labels x, y = make_classification(n_samples=1000,
n_classes=2,
n_informative=2,
n_features=4,
n_clusters_per_class=2,
class_sep=1)
Ochrana soukromí a anonymizace dat v Pythonu

Syntetická data pro klasifikaci

# See the generated data and labels
print(x.shape)
print(y.shape)
print(x)
(1000, 4)
(1000,)
[[ 1.22914870e+00 -2.62386795e+00  2.25878743e+00  2.55377055e+00]
 [-1.10279812e+00 -1.15816087e+00  1.55571279e+00  7.80565898e-02]
 [ 2.65581977e-03 -2.33278818e+00  2.37837858e+00  1.57533194e+00]
 ...
 [ 4.51006972e-01  7.53435745e-01 -9.21597108e-01 -2.20659747e-01]
 [ 5.31925876e-01  7.42210504e-01 -9.37625248e-01 -1.61488855e-01]
 [ 1.62862108e+00 -2.72435345e+00  2.22562940e+00  2.87628246e+00]]
Ochrana soukromí a anonymizace dat v Pythonu

Syntetická data pro klasifikaci

Graf datových bodů vygenerované datové sady se 2 třídami

Ochrana soukromí a anonymizace dat v Pythonu

Syntetická data pro klasifikaci

Tři grafy zobrazující vygenerovanou datovou sadu s různými hodnotami class_sep. Vlevo jsou body blízko sebe, vpravo jsou výrazně odděleny.

Ochrana soukromí a anonymizace dat v Pythonu

Syntetická data pro shlukování

# Import the datasets module for generating clustering datasets
from sklearn.datasets import make_blobs


# Specify a value for standard deviation standard_deviation = 1.5
# Generate the data and labels of the dataset x, labels = make_blobs(n_features=3, centers=4, cluster_std=standard_deviation)
# See the shape of the generated data print(x.shape)
(100, 3)
Ochrana soukromí a anonymizace dat v Pythonu

Syntetická data pro shlukování

Graf zobrazující výsledné datové body shluků, každý shluk jinou barvou. 4 středy pro 4 shluky.

Ochrana soukromí a anonymizace dat v Pythonu

Syntetická data pro shlukování

Tři grafy ukazující vliv směrodatné odchylky na datové body. Vlevo jsou body blízko středu, vpravo jsou velmi rozptýleny.

Ochrana soukromí a anonymizace dat v Pythonu

Pojďme si procvičit!

Ochrana soukromí a anonymizace dat v Pythonu

Preparing Video For Download...