R の data.table によるデータ操作
Matt Dowle and Arun Srinivasan
Instructors, DataCamp
第1引数 i は行のサブセットまたはフィルタリングに使用
# General form of data.table syntax
DT[i, j, by]
| | |
| | --> grouped by what?
| -----> what to do?
--------> on which rows?
# Subset 3rd and 4th rows from batrips
batrips[3:4]
# Same as
batrips[3:4, ]
# Subset everything except first five rows
batrips[-(1:5)]
# Same as
batrips[!(1:5)]
.N はdata.tableの行数を保持する整数値i 内で nrow(x) の代わりに使用可能nrow(batrips)
326339
batrips[326339]
trip_id duration
588914 364
# Returns the last row
batrips[.N]
trip_id duration
588914 364
# Return all but the last 10 rows
ans <- batrips[1:(.N-10)]
nrow(ans)
326329
# Subset rows where subscription_type is "Subscriber"
batrips[subscription_type == "Subscriber"]
# If batrips was only a data frame
batrips[batrips$subscription_type == "Subscriber", ]
# Subset rows where start_terminal = 58 and end_terminal is not 65
batrips[start_terminal == 58 & end_terminal != 65]
# If batrips was only a data frame
batrips[batrips$start_terminal == 58 & batrips$end_terminal != 65]
セカンダリインデックスを自動的に使用して高速化
set.seed(1)
dt <- data.table(x = sample(10000, 10e6, TRUE),
y = sample(letters, 1e6, TRUE))
indices(dt)
NULL
# 初回実行:0.207秒
#(インデックス作成+サブセット)
system.time(dt[x == 900])
user system elapsed
0.207 0.015 0.226
indices(dt)
"x"
# 2回目以降:0.002秒
#(インデックスで即時サブセット)
system.time(dt[x == 900])
user system elapsed
0.002 0.000 0.002
R の data.table によるデータ操作