操作 GRanges 的集合

R 中的 Bioconductor 入門

Paula Andrea Martinez, PhD.

Data Scientist

GRangesList

  • GRangesList-class 是用來儲存一組 GRanges 的容器
    • 適合高效儲存大量元素。
  • 建立 GRangesList
    • as(mylist, "GRangesList")
    • GRangesList(myGranges1, myGRanges2, ...)
  • 轉回 GRanges
    • unlist(myGRangesList)
  • 存取子 methods(class = "GRangesList")
R 中的 Bioconductor 入門

何時使用清單?

  • 多個 GRanges 物件可合併為一個 GRangesList
    • 清單中的 GRanges 會視為較大物件的複合特徵
  • GRangesList 的常見情境:
    • gene 的 transcripts
    • transcript 的 exons
    • read 對位
    • 滑動視窗
R 中的 Bioconductor 入門
# GRanges object with 983 genes 
hg_chrX

slidingWindows(hg_chrX, width = 20000, step = 10000)
# showing only two elements of the list
GRangesList object of length 983:
[[1]] 
GRanges object with 2 ranges and 0 metadata columns:
       seqnames           ranges strand 
         <Rle>        <IRanges>  <Rle>  
  [1]     chrX [276322, 296321]      +      
  [2]     chrX [286322, 303356]      +      
[[2]] 
GRanges object with 3 ranges and 0 metadata columns:
       seqnames           ranges strand 
  [1]     chrX [624344, 644343]      +      
  [2]     chrX [634344, 654343]      +      
  [3]     chrX [644344, 659411]      + 
...
R 中的 Bioconductor 入門

GenomicFeatures 使用 transcript 資料庫(TxDb)物件來儲存中介資料、管理基因組位置,以及特徵與其識別碼之間的關係

library(TxDb.Hsapiens.UCSC.hg38.knownGene)
(hg <- TxDb.Hsapiens.UCSC.hg38.knownGene)
Db type: TxDb
Supporting package: GenomicFeatures
Data source: UCSC
Genome: hg38
Organism: Homo sapiens
Taxonomy ID: 9606
Resource URL: http://genome.ucsc.edu/
Type of Gene ID: Entrez Gene ID
transcript_nrow: 197782 
exon_nrow: 581036 
cds_nrow: 293052 
Db created by: GenomicFeatures package from Bioconductor
Creation time: 2016-09-29 13:02:09 +0000 (Thu, 29 Sep 2016)
R 中的 Bioconductor 入門

Genes、transcripts、exons

library(TxDb.Hsapiens.UCSC.hg38.knownGene)
hg <- TxDb.Hsapiens.UCSC.hg38.knownGene  #  hg is a A TxDb object

seqlevels(hg) <- c("chrX") # prefilter results to chrX
# transcripts transcripts(hg, columns = c("tx_id", "tx_name"), filter = NULL) # exons exons(hg, columns = c("tx_id", "exon_id"), filter = list(tx_id = "179161"))

columnsfilter 可為 NULL,或下列任一者:

"gene_id", "tx_id", "tx_name", "tx_chrom", "tx_strand", 
"exon_id", "exon_name", "exon_chrom", "exon_strand", 
"cds_id", "cds_name", "cds_chrom", "cds_strand" and "exon_rank"
R 中的 Bioconductor 入門

依 transcript 分組的 exons

ABCD1 外顯子

hg <- TxDb.Hsapiens.UCSC.hg38.knownGene
seqlevels(hg) <- c("chrX")  #  prefilter chromosome X
exonsBytx <- exonsBy(hg, by = "tx")  #  exons by transcript

abcd1_179161 <- exonsBytx[["179161"]] # transcript id
width(abcd1_179161) # 每個外顯子的寬度,即圖中紫色區域
1299  181  143  169   95  146  146   85  126 1274
R 中的 Bioconductor 入門

重疊(Overlaps)

# countOverlaps 回傳整數向量(計數)
countOverlaps(query, subject) 

# findOverlaps 回傳 Hits 物件
findOverlaps(query, subject) 

# subsetByOverlaps 回傳 GRangesList 物件
subsetByOverlaps(query, subject) 
  • query 與 subject 可為 GRanges 或 GRangesList 物件。
  • 重疊可以是完整或部分。
R 中的 Bioconductor 入門

該你來實作了!

R 中的 Bioconductor 入門

Preparing Video For Download...