R で学ぶ data.table によるデータ結合
Scott Ritchie
Postdoctoral Researcher in Systems Genomics
data.tableの式は順番にチェーンできます:
demographics[...][...]
ジョインのチェーンの一般形:
DT1[DT2, on][i, j, by]
| | | | |
| | | | --> 何でグループ化するか?
| | | -----> 何をするか?
| | --------> どの行に対して?
| ------------> ジョインキー列
-----------------> どのdata.tableにジョインするか?
customers <- data.table(name = c("Mark", "Matt", "Angela", "Michelle"),
gender = c("M", "M", "F", "F"),
age = c(54, 43, 39, 63))
customers
name gender age
1: Mark M 54
2: Matt M 43
3: Angela F 39
4: Michelle F 63
purchases <- data.table(name = c("Mark", "Matt", "Angela", "Michelle"),
sales = c(1, 5, 4, 3),
spent = c(41.70, 41.78, 50.77, 60.01))
purchases
name sales spent
1: Mark 1 41.70
2: Matt 5 41.78
3: Angela 4 50.77
4: Michelle 3 60.01
customers[purchases,
on = .(name)][sales > 1,
j = .(avg_spent = sum(spent) / sum(sales)),
by = .(gender)]
gender avg_spent
1: M 13.91333
2: F 20.00333
ジョインを使った計算:
DT1[DT2, on, j]
| | |
| | ----> ジョイン結果に対して何をするか?
| --------> どの列をキーとして使うか?
-------------> どのdata.tableにジョインするか?
大規模なdata.tableに対して効率的です!
列の作成はメインのdata.tableで行われます:
customers[purchases, on = .(name), return_customer := sales > 1]
customers
name gender age return_customer
1: Mark M 54 FALSE
2: Matt M 43 TRUE
3: Angela F 39 TRUE
4: Michelle F 63 TRUE
by = .EACHIはDT2の各行ごとにjをグループ化します
DT1[DT2, on, j, by = .EACHI]
| | | |
| | | --> DT1の各マッチでグループ化。
| | -----> ジョイン結果に対して何をするか?
| ---------> どの列をキーとして使うか?
--------------> どのdata.tableにジョインするか?
shipping[customers, on = .(name),
j = .("# of shipping addresses" = .N),
by = .EACHI]

byの列によるグループ化は、計算をメインのdata.tableに限定します:
DT1[DT2, on, j, by]
| | | |
| | | --> DT1のどの列でグループ化するか?
| | -----> DT1の列に対して何をするか?
| ---------> どの列をキーとして使うか?
--------------> どのdata.tableにジョインするか?
customersでジョインしてグループ別に集計:
customers[shipping, on = .(name),
.(avg_age = mean(age)), by = .(gender)]
gender avg_age
1: M 46.66667
2: F 39.00000
R で学ぶ data.table によるデータ結合