Manipulowanie kolekcjami GRanges

Wprowadzenie do Bioconductor w R

Paula Andrea Martinez, PhD.

Data Scientist

GRangesList

  • GRangesList-class to kontener przechowujący kolekcję obiektów GRanges
    • Efektywny przy dużej liczbie elementów.
  • Tworzenie GRangesList
    • as(mylist, "GRangesList")
    • GRangesList(myGranges1, myGRanges2, ...)
  • Konwersja z powrotem do GRanges
    • unlist(myGRangesList)
  • Metody dostępu: methods(class = "GRangesList")
Wprowadzenie do Bioconductor w R

Kiedy używać list?

  • Wiele obiektów GRanges można połączyć w GRangesList
    • GRanges na liście traktowane są jako złożone cechy większego obiektu
  • Przykłady GRangesList:
    • transkrypty według genów
    • eksony według transkryptów
    • wyrównania odczytów
    • okna przesuwne
Wprowadzenie do Bioconductor w R
# GRanges object with 983 genes 
hg_chrX

slidingWindows(hg_chrX, width = 20000, step = 10000)
# showing only two elements of the list
GRangesList object of length 983:
[[1]] 
GRanges object with 2 ranges and 0 metadata columns:
       seqnames           ranges strand 
         <Rle>        <IRanges>  <Rle>  
  [1]     chrX [276322, 296321]      +      
  [2]     chrX [286322, 303356]      +      
[[2]] 
GRanges object with 3 ranges and 0 metadata columns:
       seqnames           ranges strand 
  [1]     chrX [624344, 644343]      +      
  [2]     chrX [634344, 654343]      +      
  [3]     chrX [644344, 659411]      + 
...
Wprowadzenie do Bioconductor w R

GenomicFeatures używa obiektów bazy danych transkryptów (TxDb) do przechowywania metadanych oraz zarządzania lokalizacjami genomowymi i relacjami między cechami a ich identyfikatorami.

library(TxDb.Hsapiens.UCSC.hg38.knownGene)
(hg <- TxDb.Hsapiens.UCSC.hg38.knownGene)
Db type: TxDb
Supporting package: GenomicFeatures
Data source: UCSC
Genome: hg38
Organism: Homo sapiens
Taxonomy ID: 9606
Resource URL: http://genome.ucsc.edu/
Type of Gene ID: Entrez Gene ID
transcript_nrow: 197782 
exon_nrow: 581036 
cds_nrow: 293052 
Db created by: GenomicFeatures package from Bioconductor
Creation time: 2016-09-29 13:02:09 +0000 (Thu, 29 Sep 2016)
Wprowadzenie do Bioconductor w R

Geny, transkrypty, eksony

library(TxDb.Hsapiens.UCSC.hg38.knownGene)
hg <- TxDb.Hsapiens.UCSC.hg38.knownGene  #  hg is a A TxDb object

seqlevels(hg) <- c("chrX") # prefilter results to chrX
# transcripts transcripts(hg, columns = c("tx_id", "tx_name"), filter = NULL) # exons exons(hg, columns = c("tx_id", "exon_id"), filter = list(tx_id = "179161"))

columns i filter mogą być NULL lub dowolne z poniższych:

"gene_id", "tx_id", "tx_name", "tx_chrom", "tx_strand", 
"exon_id", "exon_name", "exon_chrom", "exon_strand", 
"cds_id", "cds_name", "cds_chrom", "cds_strand" and "exon_rank"
Wprowadzenie do Bioconductor w R

Eksony według transkryptów

Eksony ABCD1

hg <- TxDb.Hsapiens.UCSC.hg38.knownGene
seqlevels(hg) <- c("chrX")  #  prefilter chromosome X
exonsBytx <- exonsBy(hg, by = "tx")  #  exons by transcript

abcd1_179161 <- exonsBytx[["179161"]] # transcript id
width(abcd1_179161) # width of each exon, the purple regions of the figure
1299  181  143  169   95  146  146   85  126 1274
Wprowadzenie do Bioconductor w R

Nakładanie się zakresów

# countOverlaps results in an integer vector of counts
countOverlaps(query, subject) 

# findOverlaps results in a Hits object
findOverlaps(query, subject) 

# subsetByOverlaps returns a GRangesList object
subsetByOverlaps(query, subject) 
  • Query i subject to obiekty GRanges lub GRangesList.
  • Nakładanie się może być całkowite lub częściowe.
Wprowadzenie do Bioconductor w R

Czas na ćwiczenia!

Wprowadzenie do Bioconductor w R

Preparing Video For Download...