문자열 유사도 비교

SQL Server 데이터베이스에서 데이터 정제하기

Miriam Antona

Software Engineer

문제 설명

  • 지저분한 문자열
| airport_state |
|---------------|
| Caalifornia   |
| California    |
| Californiaa   |
| Illinois      |
| Ilynois       |
| Tejas         |
| Texas         |
SOUNDEX
DIFFERENCE
SQL Server 데이터베이스에서 데이터 정제하기

SOUNDEX

SOUNDEX ( character_expression ) 
  • 발음 기반 알고리즘
  • 4자 코드 반환
  • 영어 기반이지만 다른 언어 단어에도 적용 가능
SELECT SOUNDEX('Illinois') AS soundex_code1;
SELECT SOUNDEX('Ilynois') AS soundex_code2;
SELECT SOUNDEX('California') AS soundex_code3;
| soundex_code1 |   | soundex_code2 |   | soundex_code3 |
|---------------|   |---------------|   |---------------|
| I452          |   | I452          |   | I416          |
SQL Server 데이터베이스에서 데이터 정제하기

SOUNDEX - 동작 방식

예: "Illinois"
  • 단어의 첫 글자를 그대로 둠
  • 첫 글자 이후 모음과 "h", "w", "y"는 0으로 치환

 

"Illinois" -> I

"Illinois" -> Ill0n00s

SQL Server 데이터베이스에서 데이터 정제하기

SOUNDEX - 동작 방식

예: "Illinois"
  • 첫 글자 이후의 자음을 숫자로 치환
SQL Server 데이터베이스에서 데이터 정제하기

SOUNDEX - 동작 방식

예: "Illinois"
  • 첫 글자 이후의 자음을 숫자로 치환
문자 숫자
b, f, p, v 1
c, g, j, k, q, s, x, z 2
d, t 3
l 4
m, n 5
r 6

 

"Ill0n00s" -> I4405002

SQL Server 데이터베이스에서 데이터 정제하기

SOUNDEX - 동작 방식

  • 연속된 동일 숫자는 하나로 축약
  • 모든 0 제거
  • 글자의 숫자가 첫 숫자와 같으면 첫 숫자 제거
  • 코드가 3자리 미만이면 0을 덧붙임
  • 3자리 초과이면 마지막 숫자 제거

"I4405002" -> I40502

"I40502" -> I452

 

"I452" (적용하지 않음)

SQL Server 데이터베이스에서 데이터 정제하기

SOUNDEX - 예외

SELECT SOUNDEX('Arizona') AS soundex_code1;
SELECT SOUNDEX('Arkansas') AS soundex_code2;
| soundex_code1 |   | soundex_code2 |
|---------------|   |---------------|
| A625          |   | A625          |
SQL Server 데이터베이스에서 데이터 정제하기

SOUNDEX - 유사성 확인

SELECT DISTINCT A1.airport_state
FROM airports A1 
INNER JOIN airports A2 
    ON SOUNDEX(A1.airport_state) = SOUNDEX(A2.airport_state)
    AND A1.airport_state <> A2.airport_state
| airport_state |
|---------------|
| Caalifornia   |
| California    |
| Californiaa   |
| Illinois      |
| Ilynois       |
| New Jersey    |
| New York      |
| Tejas         |
| Texas         |
SQL Server 데이터베이스에서 데이터 정제하기

SOUNDEX - 유사성 확인

SELECT DISTINCT A1.airport_state
FROM airports A1 
INNER JOIN airports A2 
    ON SOUNDEX(REPLACE(A1.airport_state, ' ', '')) = SOUNDEX(REPLACE(A2.airport_state, ' ', ''))
    AND A1.airport_state <> A2.airport_state

"New York" -> "NewYork"

| airport_state |
|---------------|
| Caalifornia   |
| California    |
| Californiaa   |
| Illinois      |
| Ilynois       |
| Tejas         |
| Texas         |
SQL Server 데이터베이스에서 데이터 정제하기

DIFFERENCE

DIFFERENCE ( character_expression , character_expression )  
  • 두 SOUNDEX 값을 비교
  • 0~4의 값을 반환
    • 0 -> 유사도 거의 없음
    • 4 -> 매우 유사 또는 동일
SQL Server 데이터베이스에서 데이터 정제하기

DIFFERENCE

SELECT DIFFERENCE('Illinois', 'Ilynois') AS dif_1;
| dif1 |
|------|
|  4   |
SELECT DIFFERENCE('Illinois', 'California') AS dif_2;
| dif2 |
|------|
| 1    |
SQL Server 데이터베이스에서 데이터 정제하기

DIFFERENCE - 유사성 확인

SELECT DISTINCT A1.airport_state, A2.airport_state
FROM airports A1 
INNER JOIN airports A2 
    ON DIFFERENCE(REPLACE(A1.airport_state, ' ', ''), REPLACE(A2.airport_state, ' ', '')) = 4
    AND A1.airport_state <> A2.airport_state
| airport_state | airport_state |
|---------------|---------------|
| Caalifornia   | California    |
| Caalifornia   | Californiaa   |
| California    | Caalifornia   |
| California    | Californiaa   |
| Californiaa   | Caalifornia   |
| Californiaa   | California    |
| Illinois      | Ilynois       |
| Ilynois       | Illinois      |
| Massachusetts | Michigan      |
| Tejas         | Texas         |
| Texas         | Tejas         |
SQL Server 데이터베이스에서 데이터 정제하기

Vamos praticar!

SQL Server 데이터베이스에서 데이터 정제하기

Preparing Video For Download...