比较字符串相似性

在 SQL Server 数据库中清洗数据

Miriam Antona

Software Engineer

问题描述

  • 脏乱的字符串
| airport_state |
|---------------|
| Caalifornia   |
| California    |
| Californiaa   |
| Illinois      |
| Ilynois       |
| Tejas         |
| Texas         |
SOUNDEX
DIFFERENCE
在 SQL Server 数据库中清洗数据

SOUNDEX

SOUNDEX ( character_expression ) 
  • 语音学算法
  • 返回 4 个字符的代码
  • 基于英语规则,也适用于许多其他语言的词
SELECT SOUNDEX('Illinois') AS soundex_code1;
SELECT SOUNDEX('Ilynois') AS soundex_code2;
SELECT SOUNDEX('California') AS soundex_code3;
| soundex_code1 |   | soundex_code2 |   | soundex_code3 |
|---------------|   |---------------|   |---------------|
| I452          |   | I452          |   | I416          |
在 SQL Server 数据库中清洗数据

SOUNDEX - 工作原理

示例:"Illinois"
  • 写下单词首字母
  • 首字母后将元音及字母"h""w""y"替为 0

 

"Illinois" -> I

"Illinois" -> Ill0n00s

在 SQL Server 数据库中清洗数据

SOUNDEX - 工作原理

示例:"Illinois"
  • 首字母后将辅音替换为数字
在 SQL Server 数据库中清洗数据

SOUNDEX - 工作原理

示例:"Illinois"
  • 首字母后将辅音替换为数字
字母 替换为
b, f, p, v 1
c, g, j, k, q, s, x, z 2
d, t 3
l 4
m, n 5
r 6

 

"Ill0n00s" -> I4405002

在 SQL Server 数据库中清洗数据

SOUNDEX - 工作原理

  • 相邻相同数字合并为一个
  • 移除所有 0
  • 若字母对应数字与首位数字相同,则移除首位数字
  • 代码少于 3 位时在末尾补 0
  • 多于 3 位时截断为 3 位

"I4405002" -> I40502

"I40502" -> I452

 

"I452"(不再处理)

在 SQL Server 数据库中清洗数据

SOUNDEX - 例外情况

SELECT SOUNDEX('Arizona') AS soundex_code1;
SELECT SOUNDEX('Arkansas') AS soundex_code2;
| soundex_code1 |   | soundex_code2 |
|---------------|   |---------------|
| A625          |   | A625          |
在 SQL Server 数据库中清洗数据

SOUNDEX - 相似性检查

SELECT DISTINCT A1.airport_state
FROM airports A1 
INNER JOIN airports A2 
    ON SOUNDEX(A1.airport_state) = SOUNDEX(A2.airport_state)
    AND A1.airport_state <> A2.airport_state
| airport_state |
|---------------|
| Caalifornia   |
| California    |
| Californiaa   |
| Illinois      |
| Ilynois       |
| New Jersey    |
| New York      |
| Tejas         |
| Texas         |
在 SQL Server 数据库中清洗数据

SOUNDEX - 相似性检查

SELECT DISTINCT A1.airport_state
FROM airports A1 
INNER JOIN airports A2 
    ON SOUNDEX(REPLACE(A1.airport_state, ' ', '')) = SOUNDEX(REPLACE(A2.airport_state, ' ', ''))
    AND A1.airport_state <> A2.airport_state

"New York" -> "NewYork"

| airport_state |
|---------------|
| Caalifornia   |
| California    |
| Californiaa   |
| Illinois      |
| Ilynois       |
| Tejas         |
| Texas         |
在 SQL Server 数据库中清洗数据

DIFFERENCE

DIFFERENCE ( character_expression , character_expression )  
  • 比较两个 SOUNDEX 值
  • 返回 0 到 4 的数值
    • 0 -> 几乎无相似性
    • 4 -> 非常相似或完全相同
在 SQL Server 数据库中清洗数据

DIFFERENCE

SELECT DIFFERENCE('Illinois', 'Ilynois') AS dif_1;
| dif1 |
|------|
|  4   |
SELECT DIFFERENCE('Illinois', 'California') AS dif_2;
| dif2 |
|------|
| 1    |
在 SQL Server 数据库中清洗数据

DIFFERENCE - 相似性检查

SELECT DISTINCT A1.airport_state, A2.airport_state
FROM airports A1 
INNER JOIN airports A2 
    ON DIFFERENCE(REPLACE(A1.airport_state, ' ', ''), REPLACE(A2.airport_state, ' ', '')) = 4
    AND A1.airport_state <> A2.airport_state
| airport_state | airport_state |
|---------------|---------------|
| Caalifornia   | California    |
| Caalifornia   | Californiaa   |
| California    | Caalifornia   |
| California    | Californiaa   |
| Californiaa   | Caalifornia   |
| Californiaa   | California    |
| Illinois      | Ilynois       |
| Ilynois       | Illinois      |
| Massachusetts | Michigan      |
| Tejas         | Texas         |
| Texas         | Tejas         |
在 SQL Server 数据库中清洗数据

Vamos praticar!

在 SQL Server 数据库中清洗数据

Preparing Video For Download...