추출 변환 선택

Python에서 Spark SQL 입문

Mark Plutowski

Data Scientist

ETS

Python에서 Spark SQL 입문

추출 변환 선택

Python에서 Spark SQL 입문

추출, 변환, 선택

  • 추출
  • 변환
  • 선택
Python에서 Spark SQL 입문

내장 함수

from pyspark.sql.functions import split, explode
Python에서 Spark SQL 입문

length 함수

from pyspark.sql.functions import length
df.where(length('sentence') == 0)
Python에서 Spark SQL 입문

사용자 정의 함수 만들기

  • 사용자 정의 함수
  • UDF
Python에서 Spark SQL 입문

udf 함수 임포트하기

from pyspark.sql.functions import udf
Python에서 Spark SQL 입문

불리언 UDF 만들기

print(df)
DataFrame[textdata: string]
from pyspark.sql.functions import udf
from pyspark.sql.types import BooleanType
Python에서 Spark SQL 입문

불리언 UDF 만들기

short_udf = udf(lambda x: 
                          True if not x or len(x) < 10 else False, 
                          BooleanType())
df.select(short_udf('textdata')\
  .alias("is short"))\
  .show(3)
+--------+
|is short|
+--------+
|   false|
|    true|
|   false|
+--------+
Python에서 Spark SQL 입문

주요 UDF 반환 타입

from pyspark.sql.types import StringType, IntegerType, FloatType, ArrayType
Python에서 Spark SQL 입문

배열 UDF 만들기

df3.select('word array', in_udf('word array').alias('without endword'))\
   .show(5, truncate=30)
+-----------------------------+----------------------+
|                   word array|       without endword|
+-----------------------------+----------------------+
|[then, how, many, are, there]|[then, how, many, are]|
|                  [how, many]|                 [how]|
|             [i, donot, know]|            [i, donot]|
|                  [quite, so]|               [quite]|
|   [you, have, not, observed]|      [you, have, not]|
+-----------------------------+----------------------+
Python에서 Spark SQL 입문

배열 UDF 만들기

from pyspark.sql.types import StringType, ArrayType
# Removes last item in array
in_udf = udf(lambda x: 
    x[0:len(x)-1] if x and len(x) > 1 
    else [], 
    ArrayType(StringType()))
Python에서 Spark SQL 입문

희소 벡터 형식

  1. 인덱스

예시:

  • 배열: [1.0, 0.0, 0.0, 3.0]
  • 희소 벡터: (4, [0, 3], [1.0, 3.0])
Python에서 Spark SQL 입문

벡터 데이터 다루기

  • hasattr(x, "toArray")
  • x.numNonzeros())
Python에서 Spark SQL 입문

Lass uns üben!

Python에서 Spark SQL 입문

Preparing Video For Download...