時系列データへの統計集計の適用

PostgreSQLで学ぶ時系列分析

Jasmin Ludolf

Content Developer, DataCamp

統計集計

  • 集計関数: MIN(), MAX(), SUM(), AVG(), COUNT()
  • 統計集計: 平均・中央値

分析・統計の可視化が描かれたボードを囲む4人のイラスト。

PostgreSQLで学ぶ時系列分析

平均の計算

SELECT
  AVG(views)::INTEGER as avg_views
  title
FROM dc_news_fact
JOIN dc_news_dim USING(id)
GROUP BY title
ORDER BY avg_views DESC;
|avg_views|title                      |
|---------|---------------------------|
|      207|For the Wealthiest, a Pr...|
|       12|Pet surrenders on rise a...|
|       12|Argentina's New Presiden...|
|        7|These 5 charts prove tha...|
|        7|How Is the Economy Doing...|
PostgreSQLで学ぶ時系列分析

1日あたりの平均閲覧数

WITH day_views AS (
  SELECT id, ts::DATE AS date, SUM(views) AS views
  FROM dc_news_fact
  GROUP BY id, date
)
SELECT
  AVG(views)::INTEGER AS avg
  title
FROM day_views JOIN dc_news_dim USING(id)
GROUP BY title
ORDER BY avg DESC;
PostgreSQLで学ぶ時系列分析

1日あたりの平均閲覧数

| avg|title                                                            |
|----|-----------------------------------------------------------------|
|9855|For the Wealthiest, a Private Tax System That Saves Them Billions|
| 579|Pet surrenders on rise as Fort McMurray's economy falls          |
| 574|Argentina's New President Moves Swiftly to Shake Up the Economy  |
| 352|How Is the Economy Doing? Politics May Decide Your Answer        |
| 348|These 5 charts prove that the economy does better under ...      |
PostgreSQLで学ぶ時系列分析

1日あたりの平均閲覧数

SELECT
  (SUM(views)/COUNT(DISTINCT ts::DATE))::INTEGER as avg,
  title
FROM dc_news_fact JOIN dc_news_dim USING(id)
GROUP BY title 
ORDER BY avg DESC;
|avg |title                                                            |
|----|-----------------------------------------------------------------|
|9855|For the Wealthiest, a Private Tax System That Saves Them Billions|
| 579|Pet surrenders on rise as Fort McMurray's economy falls          |
| 574|Argentina's New President Moves Swiftly to Shake Up the Economy  |
...
PostgreSQLで学ぶ時系列分析

離散中央値と連続中央値

  • 離散中央値: 中央値に最も近い先頭の値

  • 連続中央値: データ集合を半分に分ける値

要素数が奇数の場合

  • 系列 = (1, 2, 3, 4, 5)
  • 離散中央値 = 3
  • 連続中央値 = 3

要素数が偶数の場合

  • 系列 = (1, 2, 3, 4)
  • 離散中央値 = 2
  • 連続中央値 = 2.5
PostgreSQLで学ぶ時系列分析

順序付き集合集計関数

  • PERCENTILE_DISC()
  • PERCENTILE_CONT()
  • 順序付き集合集計: PERCENTILE_DISC(fraction) WITHIN GROUP (ORDER BY field)
SELECT
  PERCENTILE_CONT(0.5) WITHIN GROUP
  (ORDER BY value) AS median_cont,
  PERCENTILE_DISC(0.5) WITHIN GROUP
  (ORDER BY value) AS median_disc
FROM
(
  VALUES
  (1,1), (1,2), (1,3), (1,4), (1,5),
  (2,1), (2,5), (2,7), (2,11), (2,11)
) AS t (id, value)
GROUP BY id;
PostgreSQLで学ぶ時系列分析

順序付き集合集計関数

|median_cont|median_disc|
|-----------|-----------|
|        3.0|          3|
|        7.0|          7|
PostgreSQLで学ぶ時系列分析

中央値、分位数、パーセンタイル、四分位

  • 中央値はパーセンタイルの一種
  • パーセンタイルは分位数の一種

 

  • 分位数: 標本をほぼ等しい部分に分割
    • 四分位(4分割)
    • 十分位(10分割)
PostgreSQLで学ぶ時系列分析

四分位の計算

SELECT
  PERCENTILE_DISC(0.25) WITHIN GROUP (ORDER BY value) AS ptile_25,
  PERCENTILE_DISC(0.5) WITHIN GROUP (ORDER BY value) AS ptile_50,
  PERCENTILE_DISC(0.75) WITHIN GROUP (ORDER BY value) AS ptile_75
FROM
(
  VALUES 
  (1,1), (1,2), (1,3), (1,4), (1,5)
) AS t (id, value)
GROUP BY id;
|ptile_25|ptile_50|ptile_75|
|--------|--------|--------|
|       2|       3|       4|
PostgreSQLで学ぶ時系列分析

離散四分位の配列を計算

SELECT
  PERCENTILE_DISC(ARRAY[0.25, 0.5, 0.75]) 
  WITHIN GROUP (ORDER BY value) AS median_disc
FROM (
  VALUES
  (1,1), (1,2), (1,3), (1,4), (1,5) )
  AS t (id, value)
GROUP BY id;
|median_disc|
|-----------|
|{2,3,4}    |
PostgreSQLで学ぶ時系列分析

Passons à la pratique !

PostgreSQLで学ぶ時系列分析

Preparing Video For Download...