Создание синтетических наборов данных с помощью scikit-learn

Конфиденциальность данных и анонимизация в Python

Rebeca Gonzalez

Data engineer

Генерация наборов данных с помощью Scikit-learn

  • Можно создавать наборы данных, выбирая из вероятностных распределений

  • Например, нормального распределения

Гистограмма нормально распределённых данных

Конфиденциальность данных и анонимизация в Python

Нормальное распределение

Встречаются в природе повсеместно

  • Рост людей
  • Артериальное давление
  • Показатели IQ

Гистограмма значений роста для большого набора данных, следующего нормальному распределению

Конфиденциальность данных и анонимизация в Python

Выборка из нормального распределения

import numpy as np


# Create new pandas DataFrame new_measures = pd.DataFrame()
# Selecting the mean/center values and the standard deviation of the sample mean = 65 standard_deviation = 2
# Generating the sample new_measures['Height'] = np.random.normal(mean, standard_deviation, 10000)
Конфиденциальность данных и анонимизация в Python

Выборка из нормального распределения

# Draw histogram to see the resulting heights distribution
new_measures['Height'].hist(bins=50)

Гистограмма полученных данных

Конфиденциальность данных и анонимизация в Python

Создание наборов данных с помощью scikit-learn

В Scikit-learn есть простые и удобные функции для генерации наборов данных для задач:

  • Классификации
  • Кластеризации
  • Регрессии
Конфиденциальность данных и анонимизация в Python

Синтетические данные для классификации и кластеризации

make_classification()

  • Размещает нормально распределённые кластеры точек
  • Позволяет создавать коррелированные и неинформативные признаки

make_blobs()

  • Больший контроль над центрами и стандартными отклонениями кластеров
Конфиденциальность данных и анонимизация в Python

Синтетические данные для классификации

# Import make_classification from sklearn datasets module
from sklearn.datasets import make_classification


# Generate the samples and their labels x, y = make_classification(n_samples=1000,
n_classes=2,
n_informative=2,
n_features=4,
n_clusters_per_class=2,
class_sep=1)
Конфиденциальность данных и анонимизация в Python

Синтетические данные для классификации

# See the generated data and labels
print(x.shape)
print(y.shape)
print(x)
(1000, 4)
(1000,)
[[ 1.22914870e+00 -2.62386795e+00  2.25878743e+00  2.55377055e+00]
 [-1.10279812e+00 -1.15816087e+00  1.55571279e+00  7.80565898e-02]
 [ 2.65581977e-03 -2.33278818e+00  2.37837858e+00  1.57533194e+00]
 ...
 [ 4.51006972e-01  7.53435745e-01 -9.21597108e-01 -2.20659747e-01]
 [ 5.31925876e-01  7.42210504e-01 -9.37625248e-01 -1.61488855e-01]
 [ 1.62862108e+00 -2.72435345e+00  2.22562940e+00  2.87628246e+00]]
Конфиденциальность данных и анонимизация в Python

Синтетические данные для классификации

График точек данных в сгенерированном наборе с 2 классами

Конфиденциальность данных и анонимизация в Python

Синтетические данные для классификации

Три графика сгенерированного набора данных с разными значениями class_sep. На левом точки расположены очень близко друг к другу, на правом — сильно разделены

Конфиденциальность данных и анонимизация в Python

Синтетические данные для кластеризации

# Import the datasets module for generating clustering datasets
from sklearn.datasets import make_blobs


# Specify a value for standard deviation standard_deviation = 1.5
# Generate the data and labels of the dataset x, labels = make_blobs(n_features=3, centers=4, cluster_std=standard_deviation)
# See the shape of the generated data print(x.shape)
(100, 3)
Конфиденциальность данных и анонимизация в Python

Синтетические данные для кластеризации

График точек данных кластеризации: каждый кластер выделен своим цветом. 4 центра для 4 кластеров.

Конфиденциальность данных и анонимизация в Python

Синтетические данные для кластеризации

Три графика, показывающие влияние стандартного отклонения на точки данных. Слева кластеры сосредоточены вблизи центров, справа точки сильно рассеяны.

Конфиденциальность данных и анонимизация в Python

Давайте потренируемся!

Конфиденциальность данных и анонимизация в Python

Preparing Video For Download...