多重转换策略

SQL 中的探索性数据分析

Christina Maimone

Data Scientist

多重转换

SELECT * FROM naics;
   id   |                  category                   | businesses 
--------+---------------------------------------------+------------
 111110 | Agriculture: Soybean Farming                |       4788
 111130 | Agriculture | Dry Pea and Bean Farming      |       3606
 111140 | Agriculture: Wheat Farming                  |       6393
 111150 | Agriculture - Corn Farming                  |      26469
 111160 | Agriculture: Rice Farming                   |        949
 111199 | Agriculture - All Other Grain Farming       |      15035
 111211 | Agriculture | Potato Farming                |        617
 611110 | Education - Elementary and Secondary        |     187859
 611210 | Education | Junior Colleges                 |       3961
 611310 | Education: Colleges and Universities        |      29148
SQL 中的探索性数据分析

CASE WHEN

-- 分别处理 :, - 和 |

SELECT CASE WHEN category LIKE '%: %' THEN split_part(category, ': ', 1)
WHEN category LIKE '% - %' THEN split_part(category, ' - ', 1)
ELSE split_part(category, ' | ', 1)
END AS major_category, -- 为结果起别名
sum(businesses) -- 选择企业数量求和 FROM naics GROUP BY major_category; -- 按上面创建的类别分组
 major_category |  sum   
----------------+--------
 Education      | 220968
 Agriculture    |  57857
SQL 中的探索性数据分析

重编码表

原始值:fruit

 customer | fav_fruit 
----------+-----------
      349 | apple
      874 | Apple
      703 | apple
      667 | bannana
      622 | banana
      387 | BANANA
      300 | APPLES
      313 |  apple
      499 |  banana
      418 | apple
      841 | BANANA
      300 | APPLE
      754 | apple

标准化值:recode

 original | standardized  
----------+--------------
 APPLES   | apple
 apple    | apple  
 Apple    | apple
 bannana  | banana
 apple    | apple
  banana  | banana
 banana   | banana
 APPLE    | apple
  apple   | apple
 BANANA   | banana
SQL 中的探索性数据分析

步骤 1:CREATE TEMP TABLE

CREATE TEMP TABLE recode AS

  SELECT DISTINCT fav_fruit AS original,  -- 原始、混乱的值

         fav_fruit AS standardized        -- 新的标准化值

    FROM fruit;
SQL 中的探索性数据分析

初始表

SELECT * 
  FROM recode;
 original | standardized 
----------+--------------
 APPLES   | APPLES
 apple    | apple  
 Apple    | Apple
 bannana  | bannana
 apple    | apple
  banana  |  banana
 banana   | banana
 APPLE    | APPLE
  apple   |  apple
 BANANA   | BANANA
(10 rows)
SQL 中的探索性数据分析

步骤 2:UPDATE 值

UPDATE table_name
   SET column_name = new_value
 WHERE condition;
SQL 中的探索性数据分析

步骤 2:UPDATE 值

-- 所有行:转为小写,去除两端空格

UPDATE recode 
   SET standardized=trim(lower(original));
-- 特定行:纠正拼写错误

UPDATE recode
   SET standardized='banana'
 WHERE standardized LIKE '%nn%';
-- 所有行:去掉末尾的 s

UPDATE recode
   SET standardized=rtrim(standardized, 's');
SQL 中的探索性数据分析

recode 表结果

SELECT * 
  FROM recode;
 original | standardized 
----------+--------------
 APPLES   | apple
 apple    | apple
 Apple    | apple
 apple    | apple
  banana  | banana
 banana   | banana
 APPLE    | apple
  apple   | apple
 BANANA   | banana
 bannana  | banana
(10 rows)
SQL 中的探索性数据分析

步骤 3:JOIN 原始表与 recode 表

仅原始值

SELECT fav_fruit, count(*) 
  FROM fruit 
 GROUP BY fav_fruit;
 fav_fruit | count 
-----------+-------
 APPLES    |     1
 apple     |     1
 apple     |     3
  banana   |     1
 BANANA    |     2
  apple    |     1
 APPLE     |     1
 bannana   |     1
 banana    |     1
 Apple     |     1
(10 rows)

使用重编码值

SELECT standardized, 
       count(*) 
  FROM fruit
       LEFT JOIN recode
       ON fav_fruit=original
 GROUP BY standardized;
 standardized | count 
--------------+-------
 apple        |     8
 banana       |     5
(2 rows)
SQL 中的探索性数据分析

回顾

  1. 使用原始值 CREATE TEMP TABLE
  2. UPDATE 生成标准化值
  3. 将原始数据 JOIN 到标准化数据
SQL 中的探索性数据分析

清洗 Evanston 311 数据!

SQL 中的探索性数据分析

Preparing Video For Download...