Агрегирование данных

Преобразование и анализ данных с Microsoft Fabric

Luis Silva

Solution Architect - Data & AI

Когда следует агрегировать данные?

  • Сокращение числа строк в наборе данных с помощью функции агрегирования для получения сводных результатов.
    • Подсчёт
    • Суммирование
    • Среднее
    • Максимум
    • Минимум
Преобразование и анализ данных с Microsoft Fabric

Когда следует агрегировать данные?

  • Сокращение числа строк в наборе данных с помощью функции агрегирования для получения сводных результатов.
    • Подсчёт
    • Суммирование
    • Среднее
    • Максимум
    • Минимум

Таблица с заказами по штатам, агрегированная в новую таблицу с общим количеством заказов и суммой продаж по каждому штату

Преобразование и анализ данных с Microsoft Fabric

Инструменты для агрегирования данных

 

 

Значки трёх инструментов: SQL, Spark и Dataflows

Преобразование и анализ данных с Microsoft Fabric

Агрегирование данных с помощью SQL

  • Основные функции агрегирования в SQL:
    • SUM()
    • COUNT()
    • AVG()
    • MIN()
    • MAX()
  • Как правило, используются вместе с GROUP BY
  • Статистические функции
    • STDEV()
    • VAR()
SELECT
  <unaggregated columns>,
  function(<aggregated column>)
FROM 
  <table>
GROUP BY 
  <unaggregated columns>;
Преобразование и анализ данных с Microsoft Fabric

Агрегирование данных с помощью SQL

SELECT 
  [State], 
  COUNT([Order_ID]) AS [Num Orders], 
  SUM([Order_Amount]) AS [Total Amount]
FROM 
  [tbl_Orders]
GROUP BY 
  [State]

Таблица с заказами по штатам, агрегированная в новую таблицу с общим количеством заказов и суммой продаж по каждому штату

Преобразование и анализ данных с Microsoft Fabric

Агрегирование данных с помощью Spark

  • Основные функции агрегирования в PySpark:
    • sum()
    • count()
    • avg()
    • min() и max()
    • first() и last()
  • Статистические функции
    • stdev()
    • variance()
  • Используются вместе с groupBy() и agg()
df.groupBy(<unaggregated columns>)
.agg(function(<aggregated column>))

Преобразование и анализ данных с Microsoft Fabric

Агрегирование данных с помощью Spark

Таблица с заказами по штатам, агрегированная в новую таблицу с общим количеством заказов и суммой продаж по каждому штату

from pyspark.sql.functions import sum

df.groupBy("state").agg(count("order_id"), sum("order_amount")).show()
Преобразование и анализ данных с Microsoft Fabric

Агрегирование данных с помощью Spark

  • Функции агрегирования необходимо импортировать из pyspark.sql.functions, добавив соответствующую инструкцию в начало кода.
#----- Import one or multiple functions:
from pyspark.sql.functions import sum, avg, count, min, max

#----- Import all SQL functions:
from pyspark.sql.functions import * 

#----- Import all SQL functions with an alias:
import pyspark.sql.functions as F
# call sum: F.sum()
Преобразование и анализ данных с Microsoft Fabric

Агрегирование данных с помощью Dataflows

  • Преобразование Group by
    • Sum
    • Average
    • Median
    • Min
    • Max
    • Percentile
    • Count rows

Снимок экрана с диалоговым окном «Группировка» в Dataflows

Преобразование и анализ данных с Microsoft Fabric

Агрегирование данных с помощью Dataflows

Снимок экрана с диалоговым окном «Группировка» в Dataflow: группировка по штату с двумя агрегациями — количество строк и сумма столбца с суммой заказа

Таблица с заказами по штатам, агрегированная в новую таблицу с общим количеством заказов и суммой продаж по каждому штату

Преобразование и анализ данных с Microsoft Fabric

Давайте потренируемся!

Преобразование и анализ данных с Microsoft Fabric

Preparing Video For Download...