डेटा एग्रीगेशन

Microsoft Fabric के साथ डेटा ट्रांसफॉर्म करें और विश्लेषण करें

Luis Silva

Solution Architect - Data & AI

डेटा कब एग्रीगेट करना चाहिए?

  • एग्रीगेशन फंक्शन से सारांश निकालते हुए डेटासेट की पंक्तियों की संख्या घटाएँ.
    • Count
    • Summarize
    • Average
    • Maximum
    • Minimum
Microsoft Fabric के साथ डेटा ट्रांसफॉर्म करें और विश्लेषण करें

डेटा कब एग्रीगेट करना चाहिए?

  • एग्रीगेशन फंक्शन से सारांश निकालते हुए डेटासेट की पंक्तियों की संख्या घटाएँ.
    • Count
    • Summarize
    • Average
    • Maximum
    • Minimum

राज्यवार सेल्स ऑर्डर की टेबल, जिसे एग्रीगेट करके प्रति राज्य कुल ऑर्डर संख्या और कुल सेल्स अमाउंट की नई टेबल बनी

Microsoft Fabric के साथ डेटा ट्रांसफॉर्म करें और विश्लेषण करें

डेटा एग्रीगेशन लागू करने के टूल्स

 

 

तीन टूल्स के आइकन: SQL, Spark और Dataflows

Microsoft Fabric के साथ डेटा ट्रांसफॉर्म करें और विश्लेषण करें

SQL से डेटा एग्रीगेट करना

  • सामान्य SQL एग्रीगेशन फंक्शन:
    • SUM()
    • COUNT()
    • AVG()
    • MIN()
    • MAX()
  • आम तौर पर GROUP BY के साथ उपयोग होते हैं
  • सांख्यिकीय फंक्शन
    • STDEV()
    • VAR()
SELECT
  <unaggregated columns>,
  function(<aggregated column>)
FROM 
  <table>
GROUP BY 
  <unaggregated columns>;
Microsoft Fabric के साथ डेटा ट्रांसफॉर्म करें और विश्लेषण करें

SQL से डेटा एग्रीगेट करना

SELECT 
  [State], 
  COUNT([Order_ID]) AS [Num Orders], 
  SUM([Order_Amount]) AS [Total Amount]
FROM 
  [tbl_Orders]
GROUP BY 
  [State]

राज्यवार सेल्स ऑर्डर की टेबल, जिसे एग्रीगेट करके प्रति राज्य कुल ऑर्डर संख्या और कुल सेल्स अमाउंट की नई टेबल बनी

Microsoft Fabric के साथ डेटा ट्रांसफॉर्म करें और विश्लेषण करें

Spark से डेटा एग्रीगेट करना

  • सामान्य PySpark एग्रीगेशन फंक्शन:
    • sum()
    • count()
    • avg()
    • min() और max()
    • first() और last()
  • सांख्यिकीय फंक्शन
    • stdev()
    • variance()
  • groupBy() और agg() के साथ उपयोग करें
df.groupBy(<unaggregated columns>)
.agg(function(<aggregated column>))

Microsoft Fabric के साथ डेटा ट्रांसफॉर्म करें और विश्लेषण करें

Spark से डेटा एग्रीगेट करना

राज्यवार सेल्स ऑर्डर की टेबल, जिसे एग्रीगेट करके प्रति राज्य कुल ऑर्डर संख्या और कुल सेल्स अमाउंट की नई टेबल बनी

from pyspark.sql.functions import sum

df.groupBy("state").agg(count("order_id"), sum("order_amount")).show()
Microsoft Fabric के साथ डेटा ट्रांसफॉर्म करें और विश्लेषण करें

Spark से डेटा एग्रीगेट करना

  • एग्रीगेशन फंक्शन को आपके कोड की शुरुआत में pyspark.sql.functions से import करना होता है.
#----- Import one or multiple functions:
from pyspark.sql.functions import sum, avg, count, min, max

#----- Import all SQL functions:
from pyspark.sql.functions import * 

#----- Import all SQL functions with an alias:
import pyspark.sql.functions as F
# call sum: F.sum()
Microsoft Fabric के साथ डेटा ट्रांसफॉर्म करें और विश्लेषण करें

Dataflows के साथ डेटा एग्रीगेट करना

  • Group by ट्रांसफॉर्म
    • Sum
    • Average
    • Median
    • Min
    • Max
    • Percentile
    • Count rows

Dataflows में Group by डायलॉग का स्क्रीनशॉट

Microsoft Fabric के साथ डेटा ट्रांसफॉर्म करें और विश्लेषण करें

Dataflows के साथ डेटा एग्रीगेट करना

एक Dataflow में Group by डायलॉग का स्क्रीनशॉट, जहाँ state से ग्रुपिंग और दो एग्रीगेशन: row count और order amount कॉलम का sum सेट है

राज्यवार सेल्स ऑर्डर की टेबल, जिसे एग्रीगेट करके प्रति राज्य कुल ऑर्डर संख्या और कुल सेल्स अमाउंट की नई टेबल बनी

Microsoft Fabric के साथ डेटा ट्रांसफॉर्म करें और विश्लेषण करें

अभ्यास करते हैं!

Microsoft Fabric के साथ डेटा ट्रांसफॉर्म करें और विश्लेषण करें

Preparing Video For Download...