データのインポート

Rで学ぶBioconductorによるChIP-seq

Peter Humburg

Statistician, Macquarie University

Rで学ぶBioconductorによるChIP-seq

シーケンスリードの処理

  • 通常、Binary Sequence Alignment/Map(BAM)形式で保存されます。
  • BAMレコードのフィールド:
    • リード名:SRR1782620.7265769
    • バイナリフラグ:0
    • 参照配列名とアライメント位置:chr20 29803915
    • マッピング品質:0
    • CIGAR文字列(アライメント要約):51M
    • ペアリードの参照配列と位置(未使用):0 0
    • リード配列:AATGAAATGGAA ...
    • リード品質(ASCIIエンコード):CCCFFFFFHHHH ...
Rで学ぶBioconductorによるChIP-seq

マップ済みリードをRにインポート

  • RsamtoolsパッケージでBAMファイルを操作します。
  • RsamtoolsはBAMファイルのインデックス作成、読み込み、フィルタリング、書き込みに対応しています。

マップ済みリードのインポートにはreadGAlignmentsを使用します。

library(GenomicAlignments)
reads <- readGAlignments(bam_file)

GAlignmentsオブジェクトを返します。

Rで学ぶBioconductorによるChIP-seq

選択領域のインポート

  • BamViewsで対象領域を定義します。
library(GenomicRanges)
library(Rsamtools)
ranges <- GRanges(...)
views <- BamViews(bam_file, bamRanges=ranges)
  • その後、通常通りリードをインポートします。
reads <- readGAlignments(views)

BamViews関数は複数のBAMファイルに対応しています。

Rで学ぶBioconductorによるChIP-seq

ピークコールのインポート

BEDファイルからピークコールを読み込むにはimport.bedを使用します。

library(rtracklayer)
peaks <- import.bed(peak_bed, genome="hg19")

peaksを使用してBAMファイルのビューを定義します。

bams <- BamViews(bam_file, bamRanges=peaks)
reads <- readGAlignments(bams)
Rで学ぶBioconductorによるChIP-seq

練習しましょう!

Rで学ぶBioconductorによるChIP-seq

Preparing Video For Download...