Skapa syntetiska datamängder med scikit-learn

Dataintegritet och anonymisering i Python

Rebeca Gonzalez

Data engineer

Generera datamängder med scikit-learn

  • Vi kan skapa datamängder som samplar från sannolikhetsfördelningar

  • Till exempel normalfördelningen

Representation av ett normalfördelat histogram

Dataintegritet och anonymisering i Python

Normalfördelning

Förekommer ofta i naturen

  • Kroppslängd
  • Blodtryck
  • IQ-poäng

Histogram över längdvärden i en stor datamängd som följer en normalfördelning

Dataintegritet och anonymisering i Python

Sampla från en normalfördelning

import numpy as np


# Create new pandas DataFrame new_measures = pd.DataFrame()
# Selecting the mean/center values and the standard deviation of the sample mean = 65 standard_deviation = 2
# Generating the sample new_measures['Height'] = np.random.normal(mean, standard_deviation, 10000)
Dataintegritet och anonymisering i Python

Sampla från en normalfördelning

# Draw histogram to see the resulting heights distribution
new_measures['Height'].hist(bins=50)

Histogram över den genererade datan

Dataintegritet och anonymisering i Python

Skapa datamängder med scikit-learn

scikit-learn har enkla och lättanvända funktioner för att generera datamängder för:

  • Klassificering
  • Klustring
  • Regression
Dataintegritet och anonymisering i Python

Syntetisk data för klassificering och klustring

make_classification()

  • Placerar normalfördelade kluster av punkter
  • Kan skapa korrelerade och oinformativa särdrag

make_blobs()

  • Större kontroll över klusternas centrum och standardavvikelser
Dataintegritet och anonymisering i Python

Syntetisk data för klassificering

# Import make_classification from sklearn datasets module
from sklearn.datasets import make_classification


# Generate the samples and their labels x, y = make_classification(n_samples=1000,
n_classes=2,
n_informative=2,
n_features=4,
n_clusters_per_class=2,
class_sep=1)
Dataintegritet och anonymisering i Python

Syntetisk data för klassificering

# See the generated data and labels
print(x.shape)
print(y.shape)
print(x)
(1000, 4)
(1000,)
[[ 1.22914870e+00 -2.62386795e+00  2.25878743e+00  2.55377055e+00]
 [-1.10279812e+00 -1.15816087e+00  1.55571279e+00  7.80565898e-02]
 [ 2.65581977e-03 -2.33278818e+00  2.37837858e+00  1.57533194e+00]
 ...
 [ 4.51006972e-01  7.53435745e-01 -9.21597108e-01 -2.20659747e-01]
 [ 5.31925876e-01  7.42210504e-01 -9.37625248e-01 -1.61488855e-01]
 [ 1.62862108e+00 -2.72435345e+00  2.22562940e+00  2.87628246e+00]]
Dataintegritet och anonymisering i Python

Syntetisk data för klassificering

Graf över datapunkter i den genererade datamängden med 2 klasser

Dataintegritet och anonymisering i Python

Syntetisk data för klassificering

Tre grafer som visar den genererade datamängden med olika class_sep-värden. Till vänster ligger datapunkterna tätt ihop, till höger är de väl separerade

Dataintegritet och anonymisering i Python

Syntetisk data för klustring

# Import the datasets module for generating clustering datasets
from sklearn.datasets import make_blobs


# Specify a value for standard deviation standard_deviation = 1.5
# Generate the data and labels of the dataset x, labels = make_blobs(n_features=3, centers=4, cluster_std=standard_deviation)
# See the shape of the generated data print(x.shape)
(100, 3)
Dataintegritet och anonymisering i Python

Syntetisk data för klustring

Graf över de genererade klustringsdatapunkterna, en färg per kluster. 4 centrum för 4 kluster.

Dataintegritet och anonymisering i Python

Syntetisk data för klustring

Tre grafer som visar hur standardavvikelsen påverkar datapunkterna. Till vänster håller sig klustren nära sitt centrum, till höger är punkterna mycket spridda.

Dataintegritet och anonymisering i Python

Nu kör vi en övning!

Dataintegritet och anonymisering i Python

Preparing Video For Download...