पेयर बनाना और तुलना करना

R में डेटा क्लीनिंग

Maggie Matsui

Content Developer @ DataCamp

जब joins काम नहीं करते

बाएँ टेबल में event और time कॉलम हैं। दिखे गेम: Houston Rockets vs Chicago Bulls 19:00 पर। Miami Heat vs Los Angeles Lakers 19:00 पर। Brooklyn Nets vs Orlando Magic 20:00 पर। Denver Nuggets vs. Miami Heat 21:00 पर। San antonio spurs vs Atlanta Hawks 21:00 पर। दाएँ टेबल में गेम: NBA: Nets vs Magic 8pm पर। NBA: Bulls vs Rockets 9pm पर। NBA: Heat vs Lakers 7pm पर। NBA: Grizzlies vs Heat 10pm पर। NBA: Heat vs Cavaliers 9pm पर।

R में डेटा क्लीनिंग

जब joins काम नहीं करते

R में डेटा क्लीनिंग

Record linkage क्या है?

record_linkage_1.png

R में डेटा क्लीनिंग

Record linkage क्या है?

बाएँ, दो डेटाबेस झाड़ू के साथ, लेबल: Data A और Data B

R में डेटा क्लीनिंग

Record linkage क्या है?

Data A और Data B से तीर तीन लोगों की जोड़ियों की ओर, लेबल: Generate pairs

R में डेटा क्लीनिंग

Record linkage क्या है?

Generate pairs से तीर दो कॉलम सर्कल्स की ओर, जिनमें आपस में तीर। विवरण: compare pairs.

R में डेटा क्लीनिंग

Record linkage क्या है?

Compare pairs से तीर एक व्यक्ति की आकृति की ओर जो .93 लिखा साइन पकड़े है। लेबल: score pairs.

R में डेटा क्लीनिंग

Record linkage क्या है?

Score pairs से एक चेन की ओर तीर, लेबल: link data.

R में डेटा क्लीनिंग

Record linkage क्या है?

उसी डायग्राम में generate pairs स्टेप पर नीला बॉक्स

R में डेटा क्लीनिंग

रिकॉर्ड की जोड़ियाँ (Pairs)

दो टेबल, df_A और df_B, जिनमें लोगों के नाम, zip कोड और state हैं। df_A में Keaton Z Snyder, zip 15020, state PA हाइलाइट। df_B में Keaton Snyder, zip 15020, state PA हाइलाइट।

R में डेटा क्लीनिंग

पेयर जनरेट करना

उसी टेबलों में df_A की हर पंक्ति से df_B की हर पंक्ति तक लाइनें, यानी हर संयोजन।

R में डेटा क्लीनिंग

R में पेयर जनरेट करना

library(reclin)
pair_blocking(df_A, df_B)
Simple blocking
  No blocking used.
  First data set:  5 records
  Second data set: 5 records
  Total number of pairs: 25 pairs

ldat with 25 rows and 2 columns x y 1 1 1 2 2 1 3 3 1 ...
R में डेटा क्लीनिंग

बहुत अधिक पेयर्स

उसी टेबलों को नीचे तक बढ़ाया गया है, और भी ज़्यादा लाइन्स हर पेयर को जोड़ती हुई।

R में डेटा क्लीनिंग

Blocking

उसी टेबलें, पर केवल वही पंक्तियाँ लाइनों से जुड़ी हैं जिनका state समान है।

केवल तभी पेयर्स लें जब वे ब्लॉकिंग वैरिएबल (State) पर सहमत हों

R में डेटा क्लीनिंग

R में पेयर ब्लॉकिंग

pair_blocking(df_A, df_B, blocking_var = "state")
Simple blocking                                 ldat with 8 rows and 2 columns
  Blocking variable(s): state                     x y
  First data set:  5 records                    1 1 1
  Second data set: 5 records                    2 1 4
  Total number of pairs: 8 pairs                3 2 3
                                                4 2 5
                                                5 3 2
                                                6 4 2
                                                7 5 1
                                                8 5 4
R में डेटा क्लीनिंग

पेयर्स की तुलना

Record linkage स्टेप्स डायग्राम, compare pairs स्टेप हाइलाइटेड।

R में डेटा क्लीनिंग

पेयर्स की तुलना

pair_blocking(df_A, df_B, blocking_var = "state") %>%

compare_pairs(by = "name", default_comparator = lcs())
Compare                                     ldat with 8 rows and 3 columns            
  By: name                                      x y      name
                                              1 1 1 0.3529412
Simple blocking                               2 1 4 0.3030303
  Blocking variable(s): state                 3 2 3 0.9285714
  First data set:  5 records                  4 2 5 0.2962963    
  Second data set: 5 records                  ...
  Total number of pairs: 8 pairs              8 5 4 0.3333333
R में डेटा क्लीनिंग

एक से अधिक कॉलम की तुलना

pair_blocking(df_A, df_B, blocking_var = "state") %>%
  compare_pairs(by = c("name", "zip"), default_comparator = lcs())
Compare                                    ldat with 8 rows and 4 columns
  By: name, zip                              x y      name zip
                                           1 1 1 0.3529412 0.4
Simple blocking                            2 1 4 0.3030303 0.2
  Blocking variable(s): state              3 2 3 0.9285714 1.0
  First data set:  5 records               4 2 5 0.2962963 0.2
  Second data set: 5 records               ...
  Total number of pairs: 8 pairs           8 5 4 0.3333333 0.2
R में डेटा क्लीनिंग

अलग-अलग comparators

  • default_comparator = lcs()
  • default_comparator = jaccard()
  • default_comparator = jaro_winkler()
R में डेटा क्लीनिंग

अभ्यास करते हैं!

R में डेटा क्लीनिंग

Preparing Video For Download...