中級集計関数

Snowflakeにおけるデータパイプラインの自動化

Emily Melhuish

Technical Curriculum Developer, Snowflake

実行順序

Order of operations.png

SQL は記述順どおりに実行されません

  1. 行: データセットを構築する
  2. グループ: データを集計する
  3. 結果: 出力を整形する
1 * Snowflake Learning Material
Snowflakeにおけるデータパイプラインの自動化

主な集計関数

  • COUNT(*) / COUNT(DISTINCT col) — 総行数・一意の値
  • SUM — 合計
  • AVG — 平均
  • MIN / MAX — 範囲
SELECT COUNT(*) AS total_shipments,
       COUNT(DISTINCT carrier_id) AS unique_carriers,
       SUM(delivery_days) AS total_days,
       AVG(delivery_days) AS avg_days
FROM shipments;
Snowflakeにおけるデータパイプラインの自動化

複数クエリの問題点

リージョンおよびウェアハウス別の使用量を取得

SELECT 
region
, warehouse_name
, SUM(credits_used) 
FROM usage 
GROUP BY region, warehouse_name; 

リージョン別の小計を取得

SELECT region
, SUM(credits_used) 
FROM usage GROUP BY region; 

使用量の総計を取得

SELECT 
SUM(credits_used) 
FROM usage;
Snowflakeにおけるデータパイプラインの自動化

GROUPING SETS

入力

SELECT region
, warehouse_name
, SUM(credits_used) AS total 
FROM usage 
GROUP BY GROUPING SETS ( 
  (region, warehouse_name)
  , (region)
  , () 
);

出力

REGION WAREHOUSE_NAME TOTAL
EMEA harbr_wh_prod 1240.50
EMEA harbr_wh_dev 380.00
EMEA NULL 1620.50
APAC harbr_wh_prod 890.25
APAC NULL 890.25
NULL NULL 2510.75
  • 注: CASE 文を使用して NULL に意味を付加する
Snowflakeにおけるデータパイプラインの自動化

ROLLUP

入力

SELECT 
region
, warehouse_name
, SUM(credits_used) AS total 
FROM usage 
GROUP BY ROLLUP (region, warehouse_name);

出力

REGION WAREHOUSE_NAME TOTAL
EMEA harbr_wh_prod 1240.50
EMEA harbr_wh_dev 380.00
EMEA NULL 1620.50
APAC harbr_wh_prod 890.25
APAC NULL 890.25
NULL NULL 2510.75
Snowflakeにおけるデータパイプラインの自動化

CUBE

入力

SELECT 
region
, warehouse_name
, SUM(credits_used) AS total
FROM usage 
GROUP BY CUBE (region, warehouse_name);

出力

REGION WAREHOUSE_NAME TOTAL
EMEA harbr_wh_prod 1240.50
EMEA harbr_wh_dev 380.00
EMEA NULL 1620.50
APAC harbr_wh_prod 890.25
APAC NULL 890.25 }
NULL harbr_wh_prod 2130.75
NULL harbr_wh_dev 380.00
NULL NULL 2510.75
Snowflakeにおけるデータパイプラインの自動化

GROUPING() と GROUPING_ID()

SELECT region, warehouse_name, SUM(credits_used) AS total_credits, GROUPING(region) AS is_region_agg, GROUPING(warehouse_name) AS is_wh_agg , 
GROUPING_ID(region, warehouse_name) AS grouping_level 
FROM usage 
GROUP BY ROLLUP (region, warehouse_name);

マークダウンテーブル出力のスクリーンショット

Snowflakeにおけるデータパイプラインの自動化

練習しましょう!

Snowflakeにおけるデータパイプラインの自動化

Preparing Video For Download...