윈도 함수에서 데이터 분할하기

Snowflake의 Window 함수

Jake Roach

Field Data Engineer

데이터 랭킹

여기서는 결과 집합의 모든 레코드를 랭킹합니다!

      user_id  |    event_name   |  km_traveled  |  closest_attendees 
      -------  | --------------- | ------------- | ----------------- 
      user_81  |  Lunar Drift    |      0.5      |         1         
      user_02  |  Lunar Drift    |      1.1      |         2       
      user_33  |  Crimson Arc    |      8.6      |         3          
      user_33  |  Neon Prophet   |      8.6      |         3         
      user_15  |  VibeStorm      |      17       |         5          
      user_94  |  The Dusk Owls  |      41       |         6        
      user_47  |  Lunar Drift    |      61       |         7   
      user_56  |  Crimson Arc    |      116      |         8         
Snowflake의 Window 함수

파티션으로 데이터 랭킹

이제 지정한 각 윈도별로 랭킹을 매깁니다.

각 공연장까지 이동 거리로 참석자를 랭킹하는 표

Snowflake의 Window 함수

PARTITION BY

SELECT
    user_id,
    event_name,
    distance_traveled,

    RANK() OVER(
        -- event_name으로 윈도 생성
        PARTITION BY event_name
        ORDER BY km_traveled
    ) AS closest_concert_goer

FROM CONCERTS.attendance;

PARTITION BY는 함수 적용을 위한 레코드 윈도를 만듭니다

$$

  • OVER(...)에서 PARTITION BYORDER BY보다 먼저 옵니다
  • GROUP BY와 유사하지만 레코드를 "축약"하지 않습니다
Snowflake의 Window 함수

파티션으로 데이터 랭킹

SELECT
    level,
    price,

    RANK() OVER(
        PARTITION BY level
        ORDER BY price DESC
    ) AS price_rank

FROM CONCERTS.attendance;
  • PARTITION BY가 윈도를 생성합니다
      level  |   price   | price_rank 
    -------- | --------- | -----------
       100   |    765    |      1
       100   |    617    |      2
       100   |    490    |      3
       100   |    490    |      3

                  ...

       200   |    212    |      1
       200   |    207    |      2

                  ...
Snowflake의 Window 함수

FIRST_VALUE로 요약 지표 생성

    FIRST_VALUE(<1>) OVER(
        PARTITION BY <2>
        ORDER BY <3>
    ) AS <alias>

FIRST_VALUE는 윈도에서 첫 값을 찾습니다

    <1>: 반환할 컬럼

    <2>: 데이터를 분할할 필드

    <3>: 첫 레코드를 결정할 필드

Snowflake의 Window 함수

AVG로 요약 지표 생성

AVG(<1>) OVER(
    PARTITION BY <2>
    -- No need to ORDER BY!
) AS <alias>

AVG는 각 윈도의 평균을 계산합니다

    <1>: 평균을 낼 컬럼

    <2>: 데이터를 분할할 필드

$$

                                                                                                      ... ORDER BY 불필요!

Snowflake의 Window 함수

고객 만족도

SELECT
    user_id, event_name, satisfaction_score,

FIRST_VALUE(satisfaction_score) OVER( PARTITION BY event_name -- 가장 가까운 관객의 만족도 점수 ORDER BY km_traveled ) AS first_score,
-- 레코드 "윈도"의 평균 만족도 점수 계산 AVG(satisfaction_score) OVER( PARTITION BY event_name ) AS average_score
FROM CONCERTS.attendance;
Snowflake의 Window 함수

고객 만족도


      user_id  |   event_name   |  satisfaction_score  |  first_score  |  average_score 
     --------- | -------------- | -------------------- | ------------- | ---------------

      user_26  |  Pulse Theory  |          71          |       98      |      84.5      
      user_92  |  Pulse Theory  |          98          |       98      |      84.5      

                                          ...

      user_57  |   Nova Sway    |           4          |       22      |      29.3      
      user_39  |   Nova Sway    |          22          |       22      |      29.3      
      user_44  |   Nova Sway    |          62          |       22      |      29.3      

                                          ...
Snowflake의 Window 함수

Vamos praticar!

Snowflake의 Window 함수

Preparing Video For Download...