ゲノムブラウザを使いこなす

公共データを、自分の座標系に持ち込む

← 動画でワークフロー 一覧へ

UCSC Genome Browser は、ゲノムの可視化だけじゃなく、膨大な公共アノテーションから必要な部分だけを切り出し、自分のデータと同じ土俵に載せるための道具でもあります。このワークフローでは、可視化ツールから一歩進んで、絞り込んで取り出し、自分のデータを重ね、最後に手元のマシンで詳しく見るところまでをたどります。

  1. 1

    UCSC Table Browser

    眺めるブラウザから、取り出すブラウザへ

    最初の一歩は、画面をスクロールして眺めるのをやめることです。Table Browser を使うと、UCSC が持つ多様なアノテーショントラックに対して条件を指定し、必要な範囲・必要な項目だけを表形式で取り出せます。「この染色体領域にある遺伝子の一覧がほしい」といった要求が、数クリックで満たせるようになります

    UCSC Table Browserを使って多様なアノテーショントラックからデータを絞り込み閲覧・取得する 8:58

  2. 2

    UCSC Table Browser

    座標のリストから、実際の塩基配列へ

    領域が決まったら、次はその中身、つまり配列そのものを取ってきます。同じ Table Browser から cDNA の配列を FASTA 形式でダウンロードできます。プライマー設計、アラインメント、その先の解析——どれも配列ファイルが手元にあってはじめて始まります。「ブラウザで見えているもの」を「解析に使えるファイル」に。

    UCSC Table Browserを使ってcDNAの配列ファイルをダウンロードする 8:38

  3. 3

    UCSC Genome Browser

    公共データの上に、自分の結果を載せる

    取り出すのではなく、配列を持ち込んで使う。カスタムトラック機能を使えば、自分の WIG(シグナル強度)や VCF(バリアント)のファイルを、公共のアノテーションと同じ画面上に並べて表示することができます。「自分のピークは既知のプロモーター領域と重なっているのか」といった問いに、目で見て答えられるようになります。

    UCSC Genome Browserを使ってWIG、VCFファイルをカスタムトラックとして追加する 10:35

  4. 4

    UCSC LiftOver

    つまずきポイント ― ゲノムバージョンが違うと重ならない

    自分のデータが hg19 で、公共データが hg38。よくある落とし穴です。座標系が違えば、同じ位置を指しているつもりでもまったく別の場所を見ていることになります。Lift Genome Annotations(LiftOver)は、あるリファレンス配列の座標を別のバージョンへ対応付ける道具です。地味ですが、これを知らないと結果が静かに間違うので、必ず押さえておきたいステップです。

    UCSC Lift Genome Annotations を使ってゲノム座標データをリファレンス配列間で対応付ける 6:55

  5. 5

    IGV

    最後は自分のマシンで、リードの1本1本まで

    ウェブブラウザでは扱いにくい大きなファイルや、公開前のデータを見るときは、手元で動くビューアの出番です。Integrative Genomics Viewer (IGV) はデスクトップアプリで、BAM ファイルのリードを1本ずつ確認するような細かい検証ができます。「変異のように見えるが、実はシーケンスエラーではないか」を判断するには、この解像度が要ります。また、マイクロアレイなどの遺伝子発現データの可視化なども同時に行うことができます。

    Integrative Genomics Viewer (IGV) を使ってゲノムデータを可視化する 11:09

まとめ

切り出す → 配列にする → 自分のデータを重ねる → 座標を揃える → 手元で精査する。ゲノムブラウザが「見るもの」から「作業台」に変わったはずです。とくにステップ4の座標変換は、間違えても画面上はそれらしく見えてしまうため、事故が起きやすい場所です。ここだけでも覚えて帰ってください。

さらに学ぶ