Dataaggregering

Transformera och analysera data med Microsoft Fabric

Luis Silva

Solution Architect - Data & AI

När bör du aggregera data?

  • Minska antalet rader i en datamängd med en aggregeringsfunktion för att skapa sammanfattningar.
    • Räkna
    • Sammanfatta
    • Medelvärde
    • Maximum
    • Minimum
Transformera och analysera data med Microsoft Fabric

När bör du aggregera data?

  • Minska antalet rader i en datamängd med en aggregeringsfunktion för att skapa sammanfattningar.
    • Räkna
    • Sammanfatta
    • Medelvärde
    • Maximum
    • Minimum

Tabell med försäljningsorder per stat aggregerade till en ny tabell med totalt antal order och total försäljning per stat

Transformera och analysera data med Microsoft Fabric

Verktyg för dataaggregering

 

 

Ikoner som representerar tre verktyg: SQL, Spark och Dataflows

Transformera och analysera data med Microsoft Fabric

Aggregera data med SQL

  • Vanliga SQL-aggregeringsfunktioner:
    • SUM()
    • COUNT()
    • AVG()
    • MIN()
    • MAX()
  • Används vanligtvis tillsammans med GROUP BY
  • Statistiska funktioner
    • STDEV()
    • VAR()
SELECT
  <unaggregated columns>,
  function(<aggregated column>)
FROM 
  <table>
GROUP BY 
  <unaggregated columns>;
Transformera och analysera data med Microsoft Fabric

Aggregera data med SQL

SELECT 
  [State], 
  COUNT([Order_ID]) AS [Num Orders], 
  SUM([Order_Amount]) AS [Total Amount]
FROM 
  [tbl_Orders]
GROUP BY 
  [State]

Tabell med försäljningsorder per stat aggregerade till en ny tabell med totalt antal order och total försäljning per stat

Transformera och analysera data med Microsoft Fabric

Aggregera data med Spark

  • Vanliga PySpark-aggregeringsfunktioner:
    • sum()
    • count()
    • avg()
    • min() och max()
    • first() och last()
  • Statistiska funktioner
    • stdev()
    • variance()
  • Används med groupBy() och agg()
df.groupBy(<unaggregated columns>)
.agg(function(<aggregated column>))

Transformera och analysera data med Microsoft Fabric

Aggregera data med Spark

Tabell med försäljningsorder per stat aggregerade till en ny tabell med totalt antal order och total försäljning per stat

from pyspark.sql.functions import sum

df.groupBy("state").agg(count("order_id"), sum("order_amount")).show()
Transformera och analysera data med Microsoft Fabric

Aggregera data med Spark

  • Aggregeringsfunktioner måste importeras från pyspark.sql.functions med ett importuttryck i början av koden.
#----- Import one or multiple functions:
from pyspark.sql.functions import sum, avg, count, min, max

#----- Import all SQL functions:
from pyspark.sql.functions import * 

#----- Import all SQL functions with an alias:
import pyspark.sql.functions as F
# call sum: F.sum()
Transformera och analysera data med Microsoft Fabric

Aggregera data med Dataflows

  • Gruppera efter-transformering
    • Sum
    • Average
    • Median
    • Min
    • Max
    • Percentile
    • Count rows

Skärmbild av dialogrutan Gruppera efter i Dataflows

Transformera och analysera data med Microsoft Fabric

Aggregera data med Dataflows

Skärmbild av dialogrutan Gruppera efter i ett Dataflow, med inställning att data grupperas efter stat samt två aggregeringar: antal rader och summan av kolumnen order_amount

Tabell med försäljningsorder per stat aggregerade till en ny tabell med totalt antal order och total försäljning per stat

Transformera och analysera data med Microsoft Fabric

Nu kör vi en övning!

Transformera och analysera data med Microsoft Fabric

Preparing Video For Download...