Limpieza de datos en R
Maggie Matsui
Content Developer @ DataCamp











library(reclin)
pair_blocking(df_A, df_B)
Simple blocking No se usa bloqueo. Primer conjunto de datos: 5 registros Segundo conjunto de datos: 5 registros Número total de pares: 25 paresldat con 25 filas y 2 columnas x y 1 1 1 2 2 1 3 3 1 ...


Considera pares solo cuando coincidan en la variable de bloqueo (State)
pair_blocking(df_A, df_B, blocking_var = "state")
Simple blocking ldat con 8 filas y 2 columnas
Variable(s) de bloqueo: state x y
Primer conjunto de datos: 5 registros 1 1 1
Segundo conjunto de datos: 5 registros 2 1 4
Número total de pares: 8 pares 3 2 3
4 2 5
5 3 2
6 4 2
7 5 1
8 5 4

pair_blocking(df_A, df_B, blocking_var = "state") %>%compare_pairs(by = "name", default_comparator = lcs())
Compare ldat con 8 filas y 3 columnas
By: name x y name
1 1 1 0.3529412
Simple blocking 2 1 4 0.3030303
Variable(s) de bloqueo: state 3 2 3 0.9285714
Primer conjunto de datos: 5 registros 4 2 5 0.2962963
Segundo conjunto de datos: 5 registros ...
Número total de pares: 8 pares 8 5 4 0.3333333
pair_blocking(df_A, df_B, blocking_var = "state") %>%
compare_pairs(by = c("name", "zip"), default_comparator = lcs())
Compare ldat con 8 filas y 4 columnas
By: name, zip x y name zip
1 1 1 0.3529412 0.4
Simple blocking 2 1 4 0.3030303 0.2
Variable(s) de bloqueo: state 3 2 3 0.9285714 1.0
Primer conjunto de datos: 5 registros 4 2 5 0.2962963 0.2
Segundo conjunto de datos: 5 registros ...
Número total de pares: 8 pares 8 5 4 0.3333333 0.2
default_comparator = lcs()default_comparator = jaccard()default_comparator = jaro_winkler()Limpieza de datos en R