R में Bioconductor परिचय
Paula Andrea Martinez, PhD.
Data Scientist
डुप्लिकेट हटाएँ या कम से कम मार्क करें
थ्रेशोल्ड से डुप्लिकेट मार्क करें
library(ShortRead)# डुप्लिकेट की गिनती, TRUE डुप्लिकेट की संख्या देता है table(srduplicated(dfqsample))
FALSE TRUE
500 500
# डुप्लिकेट से रीड्स साफ करना x[fun(x)] cleanReads <- mydReads[srduplicated(mydReads) == FALSE]# डुप्लिकेट की गिनती table(srduplicated(cleanReads))
FALSE
500
srFilter से किसी कंडीशन पर फ़िल्टर करें x[fun(x)]
फ़िल्टर उदाहरण
library(ShortRead)# fqsample से रीड्स हटाने के लिए कस्टम फ़िल्टर # यह फ़िल्टर min बेस से छोटे रीड्स हटाता है readWidthCutOff <- srFilter(function(x) {width(x) >= minWidth}, name = "MinWidth")minWidth <- 51fqsample[readWidthCutOff(fqsample)]
library(ShortRead)# अपना फ़िल्टर सेव करें, .name वैकल्पिक है myFilter <- nFilter(threshold = 10, .name = "cleanNFilter")# पढ़ते समय फ़िल्टर का उपयोग करें filtered <- readFastq(dirPath = "data", pattern = ".fastq", filter = myFilter) # आपको केवल वे रीड्स मिलेंगे जिनमें अधिकतम 10 N's हैं filtered
library(ShortRead)# id फ़िल्टर उदाहरण myFilterID <- idFilter(regex = ":3:1") # केवल वे id लौटेंगी जिनमें यह रेगुलर एक्सप्रेशन है # वैकल्पिक पैरामीटर हैं .name, fixed और exclude # पढ़ते समय फ़िल्टर का उपयोग करें filtered <- readFastq(dirPath = "data", pattern = ".fastq", filter = myFilterID)# poly-A रीजन हटाने का फ़िल्टर myFilterPolyA <- polynFilter(threshold = 10, nuc = c("A")) # वे सीक्वेंस लौटेंगे जिनमें अधिकतम 10 लगातार A's हैं# सबसेटिंग के लिए फ़िल्टर का उपयोग करें filtered[myFilterPolyA(filtered)]
R में Bioconductor परिचय