버킷팅 & 엔지니어링

PySpark로 하는 Machine Learning

Andrew Collier

Data Scientist, Fathom Data

버킷팅

연속값을 구간으로 묶기

PySpark로 하는 Machine Learning

키 높이 버킷팅

키 높이 히스토그램

+------+
|height|
+------+
|  1.42|
|  1.45|
|  1.47|
|  1.50|
|  1.52|
|  1.57|
|  1.60|
|  1.75|
|  1.85|
|  1.88|
+------+
PySpark로 하는 Machine Learning

키 높이 버킷팅

구간이 표시된 키 높이 히스토그램

+------+
|height|
+------+
|  1.42|
|  1.45|
|  1.47|
|  1.50|
|  1.52|
|  1.57|
|  1.60|
|  1.75|
|  1.85|
|  1.88|
+------+
PySpark로 하는 Machine Learning

키 높이 버킷팅

구간과 레이블이 있는 키 높이 히스토그램

+------+
|height|
+------+
|  1.42|
|  1.45|
|  1.47|
|  1.50|
|  1.52|
|  1.57|
|  1.60|
|  1.75|
|  1.85|
|  1.88|
+------+
PySpark로 하는 Machine Learning

키 높이 버킷팅

구간과 레이블이 있는 키 높이 히스토그램

+------+----------+
|height|height_bin|
+------+----------+
|  1.42|     short|
|  1.45|     short|
|  1.47|     short|
|  1.50|     short|
|  1.52|   average|
|  1.57|   average|
|  1.60|   average|
|  1.75|   average|
|  1.85|      tall|
|  1.88|      tall|
+------+----------+
PySpark로 하는 Machine Learning

RPM 히스토그램

자동차 RPM에는 “자연스러운” 경계가 있습니다:

  • $\text{RPM} < 4500$ — 낮음
  • $\text{RPM} > 6000$ — 높음
  • 그 외 — 중간

구간과 레이블이 있는 RPM 히스토그램

PySpark로 하는 Machine Learning

RPM 버킷

from pyspark.ml.feature import Bucketizer

bucketizer = Bucketizer(splits=[3500, 4500, 6000, 6500],
                        inputCol="rpm",
                        outputCol="rpm_bin")

rpm 열에 버킷을 적용합니다.

bucketed = bucketizer.transform(cars)
PySpark로 하는 Machine Learning

RPM 버킷

bucketed.select('rpm', 'rpm_bin').show(5)
+----+-------+
| rpm|rpm_bin|
+----+-------+
|3800|    0.0|
|4500|    1.0|
|5750|    1.0|
|5300|    1.0|
|6200|    2.0|
+----+-------+
bucketed.groupBy('rpm_bin').count().show()
+-------+-----+
|rpm_bin|count|
+-------+-----+
|    0.0|    8| <- 낮음
|    1.0|   67| <- 중간
|    2.0|   17| <- 높음
+-------+-----+
PySpark로 하는 Machine Learning

원-핫 인코딩된 RPM 버킷

RPM 버킷을 원-핫 인코딩하여 더미 변수로 만듭니다.

+-------+-------------+
|rpm_bin|    rpm_dummy|
+-------+-------------+
|    0.0|(2,[0],[1.0])| <- 낮음
|    1.0|(2,[1],[1.0])| <- 중간
|    2.0|    (2,[],[])| <- 높음
+-------+-------------+

'high' RPM 버킷은 기준 수준이므로 더미 변수가 없습니다.

PySpark로 하는 Machine Learning

버킷팅된 RPM 모델

regression.coefficients
DenseVector([1.3814, 0.1433])
+-------+-------------+
|rpm_bin|    rpm_dummy|
+-------+-------------+
|    0.0|(2,[0],[1.0])| <- 낮음
|    1.0|(2,[1],[1.0])| <- 중간
|    2.0|    (2,[],[])| <- 높음
+-------+-------------+
regression.intercept
8.1835

'낮음' RPM의 소비량:

8.1835 + 1.3814 = 9.5649

'중간' RPM의 소비량:

8.1835 + 0.1433 = 8.3268
PySpark로 하는 Machine Learning

추가 특징 엔지니어링

단일 열 연산:

  • log()
  • sqrt()
  • pow()

두 열 연산:

  • 비율
PySpark로 하는 Machine Learning

체중·키로 BMI 계산

키 높이 히스토그램

몸무게 히스토그램

PySpark로 하는 Machine Learning

체중·키로 BMI 계산

BMI 히스토그램

+------+-----+----+
|height| mass| bmi|    bmi = mass / height^2
+------+-----+----+
|  1.52| 77.1|33.2|
|  1.60| 58.1|22.7|
|  1.57|122.0|49.4|
|  1.75| 95.3|31.0|
|  1.80| 99.8|30.7|
|  1.65| 90.7|33.3|
|  1.60| 70.3|27.5|
|  1.78| 81.6|25.8|
|  1.65| 77.1|28.3|
|  1.78|128.0|40.5|
+------+-----+----+
PySpark로 하는 Machine Learning

밀도 엔지니어링

cars = cars.withColumn('density_line', cars.mass / cars.length)       # Linear density
cars = cars.withColumn('density_quad', cars.mass / cars.length**2)    # Area density
cars = cars.withColumn('density_cube', cars.mass / cars.length**3)    # Volume density
+------+------+------------+------------+------------+
|  mass|length|density_line|density_quad|density_cube|
+------+------+------------+------------+------------+
|1451.0| 4.775|303.87434554|63.638606397|13.327456837|
|1129.0| 4.623|244.21371403|52.825808790|11.426737787|
|1399.0| 4.547|307.67539036|67.665579583|14.881367843|
+------+------+------------+------------+------------+
PySpark로 하는 Machine Learning

특징을 만들어 봅시다!

PySpark로 하는 Machine Learning

Preparing Video For Download...