Вступ до Bioconductor в R
Paula Andrea Martinez, PhD.
Data Scientist
Вилучіть дублікати або принаймні позначте їх
Позначайте дублікати за порогом
library(ShortRead)# Підрахунок дублікатів: TRUE — це кількість дублікатів table(srduplicated(dfqsample))
FALSE TRUE
500 500
# Очищення рідів від дублікатів x[fun(x)] cleanReads <- mydReads[srduplicated(mydReads) == FALSE]# Підрахунок дублікатів table(srduplicated(cleanReads))
FALSE
500
srFilter для фільтрації за умовою x[fun(x)]
Приклад фільтра
library(ShortRead)# Використайте власний фільтр, щоб прибрати ріди з fqsample # Цей фільтр видаляє ріди коротші за мінімальну довжину readWidthCutOff <- srFilter(function(x) {width(x) >= minWidth}, name = "MinWidth")minWidth <- 51fqsample[readWidthCutOff(fqsample)]
library(ShortRead)# збережіть свій фільтр, .name не обов'язково myFilter <- nFilter(threshold = 10, .name = "cleanNFilter")# застосуйте фільтр під час читання filtered <- readFastq(dirPath = "data", pattern = ".fastq", filter = myFilter) # ви отримаєте лише ріди з максимум 10 N filtered
library(ShortRead)# приклад фільтра за id myFilterID <- idFilter(regex = ":3:1") # поверне лише ті id, що містять цей регулярний вираз # необов'язкові параметри: .name, fixed і exclude # застосуйте фільтр під час читання filtered <- readFastq(dirPath = "data", pattern = ".fastq", filter = myFilterID)# фільтр для видалення полі-A ділянок myFilterPolyA <- polynFilter(threshold = 10, nuc = c("A")) # поверне послідовності з не більш як 10 послідовними A# використайте фільтр для підмножини filtered[myFilterPolyA(filtered)]
Вступ до Bioconductor в R