data.tableの行フィルタリング

R の data.table によるデータ操作

Matt Dowle and Arun Srinivasan

Instructors, DataCamp

data.tableの基本構文

第1引数 i は行のサブセットまたはフィルタリングに使用

# General form of data.table syntax
DT[i, j, by]
   |  |  |
   |  |  --> grouped by what?
   |  -----> what to do?
   --------> on which rows?
R の data.table によるデータ操作

行番号

# Subset 3rd and 4th rows from batrips
batrips[3:4]

# Same as
batrips[3:4, ]
# Subset everything except first five rows
batrips[-(1:5)] 

# Same as
batrips[!(1:5)]
R の data.table によるデータ操作

特殊シンボル .N

  • .N はdata.tableの行数を保持する整数値
  • i 内で nrow(x) の代わりに使用可能
nrow(batrips) 
326339
batrips[326339]
trip_id duration
588914      364
# Returns the last row
batrips[.N] 
trip_id duration
588914      364
# Return all but the last 10 rows
ans <- batrips[1:(.N-10)] 
nrow(ans)
326329
R の data.table によるデータ操作

論理式(I)

# Subset rows where subscription_type is "Subscriber"
batrips[subscription_type == "Subscriber"]

# If batrips was only a data frame
batrips[batrips$subscription_type == "Subscriber", ]
R の data.table によるデータ操作

論理式(II)

# Subset rows where start_terminal = 58 and end_terminal is not 65
batrips[start_terminal == 58 & end_terminal != 65]

# If batrips was only a data frame
batrips[batrips$start_terminal == 58 & batrips$end_terminal != 65]
R の data.table によるデータ操作

論理式(III)

セカンダリインデックスを自動的に使用して高速化

set.seed(1)
dt <- data.table(x = sample(10000, 10e6, TRUE), 
                 y = sample(letters, 1e6, TRUE))
indices(dt)
NULL
# 初回実行:0.207秒
#(インデックス作成+サブセット)
system.time(dt[x == 900])
user  system elapsed 
0.207   0.015   0.226 
indices(dt)
"x"
# 2回目以降:0.002秒
#(インデックスで即時サブセット)
system.time(dt[x == 900])
user  system elapsed 
0.002   0.000   0.002
R の data.table によるデータ操作

練習しましょう!

R の data.table によるデータ操作

Preparing Video For Download...