Топ-значення за допомогою віконних функцій

Аналіз часових рядів у PostgreSQL

Jasmin Ludolf

Content Developer, DataCamp

Опис таблиці

  • таблиця temperatures_monthly
  • Поля:
    • station_id — ідентифікатор метеостанції
    • year_month — рік і місяць
    • t_monthly_min — мінімальна місячна температура, °C
    • t_monthly_max — максимальна місячна температура, °C
    • t_monthly_avg — середня місячна температура, °C
Аналіз часових рядів у PostgreSQL

Традиційна агрегація

SELECT station_id, year_month, t_monthly_min
FROM temperatures_monthly AS tm
JOIN

( SELECT station_id, min(t_monthly_min) AS t_monthly_min FROM temperatures_monthly WHERE year_month BETWEEN '2018-01-01' AND '2018-12-31' GROUP BY station_id ) as p USING(station_id, t_monthly_min) WHERE year_month BETWEEN '2018-01-01' AND '2018-12-31' ORDER BY station_id, t_monthly_min;
Аналіз часових рядів у PostgreSQL

Традиційна агрегація

|station_id|year_month|t_monthly_min|
|----------|----------|-------------|
|         1|2018-12-01|          5.4|
|         2|2018-12-01|          6.6|
|         3|2018-01-01|          1.6|
|         3|2018-02-01|          1.6|
|         4|2018-02-01|        -19.0|
|         6|2018-01-01|          2.6|
|         8|2018-02-01|        -16.3|

Проблеми:

  • Станція 5 відсутня — немає даних за 2018 рік
  • Два рядки для станції 3 — однакова мінімальна температура 3
  • Повертає лише найхолодніший один місяць. А якщо потрібні два найхолодніші?
Аналіз часових рядів у PostgreSQL

Використання row_number

  • Треба пронумерувати рядки для кожної станції
  • ROW_NUMBER() — нумерує рядки в межах секції у зростальному порядку

 

SELECT station_id, year_month, t_monthly_min,
    ROW_NUMBER() OVER (PARTITION BY station_id ORDER BY t_monthly_min) AS rank
FROM temperatures_monthly AS tm
WHERE year_month BETWEEN '2018-01-01' AND '2018-12-31'
ORDER BY station_id, t_monthly_min;
Аналіз часових рядів у PostgreSQL

Нумерація рядків

|station_id|year_month|t_monthly_min|rank|
|----------|----------|-------------|----|
|         1|2018-12-01|          5.4|   1|
|         1|2018-02-01|          6.2|   2|
|         1|2018-01-01|          7.4|   3|
|         1|2018-11-01|          9.0|   4|
|         1|2018-03-01|         10.6|   5| 
|         1|2018-04-01|         14.7|   6|
|         1|2018-10-01|         16.6|   7|
|         1|2018-05-01|         17.2|   8|
|         1|2018-06-01|         21.9|   9|
|         1|2018-09-01|         24.4|  10|
|         1|2018-07-01|         28.1|  11|
|         1|2018-08-01|         28.1|  12|
|         2|2018-12-01|          6.6|   1|
|         2|2018-01-01|          7.6|   2|
|         2|2018-02-01|          8.1|   3|
  • Нумерація починається знову для станції 2
  • Бо ми зробили секцію за station_id
Аналіз часових рядів у PostgreSQL

Найнижчі температури

SELECT * FROM
(
    SELECT station_id, year_month, t_monthly_min,
    ROW_NUMBER() OVER 
          (PARTITION BY station_id ORDER BY t_monthly_min) AS rank
    FROM temperatures_monthly
    WHERE year_month BETWEEN '2018-01-01' AND '2018-12-31'
) AS q
WHERE rank < 3
ORDER BY station_id, rank;
Аналіз часових рядів у PostgreSQL

Найнижчі температури

|station_id|year_month|t_monthly_min|rank|
|----------|----------|-------------|----|
|         1|2018-12-01|          5.4|   1|
|         1|2018-02-01|          6.2|   2|
|         2|2018-12-01|          6.6|   1|
|         2|2018-01-01|          7.6|   2|
|         3|2018-01-01|          1.6|   1|
|         3|2018-02-01|          1.6|   2|
Аналіз часових рядів у PostgreSQL

Найвищі значення

  • Щоб змінити порядок на зворотний, додайте DESC:
ROW_NUMBER() OVER (PARTITION BY station_id ORDER BY t_monthly_min DESC)
Аналіз часових рядів у PostgreSQL

Давайте потренуємось!

Аналіз часових рядів у PostgreSQL

Preparing Video For Download...