他人が出したデータで、自分の仮説を確かめる
← 動画でワークフロー 一覧へ自分でシーケンスを回さなくても、確かめられることはたくさんあります。公共データベースには膨大なRNA-seqデータが眠っていて、「この遺伝子はあの条件で本当に上がっているのか」といった問いなら、手元にサンプルがなくても検証できます。このワークフローは、データを探すところから、発現変動を出し、生物学的な意味づけをして、パスウェイの上に載せるまでをひと続きでたどります。プログラミング環境の構築は不要で、すべてブラウザ上のツールで完結します。
ワークフロー
NCBI GEO
解析の前に、材料を見つけるところから始めます。NCBI GEO は世界中の発現データが集まるアーカイブで、生物種・組織・処理条件などから目的のデータセットを探せます。ここで大事なのは「何が登録されているか」だけでなく「実験デザインが自分の問いに合っているか」を見極めること。対照群と処理群がきちんと揃っているか、反復数は足りているか——このステップで見る目を養っておくと、後の解析が空振りしません。
NCBI GEO
使えそうなデータセットが見つかったら、実際に取ってきます。ここで分かれ道があります。FASTQ の生データから自分で処理するのか、登録者が計算済みのカウントデータを使うのか。前者は自由度が高い代わりに計算環境が要り、後者はすぐ次のステップに進めます。このワークフローでは後者を選びますが、どちらを選ぶとその先がどうなるかを、この動画で押さえておきましょう。
RNAseqChef
いよいよ解析の中心です。RNAseqChef はブラウザ上で公共RNA-seqデータの発現変動解析ができるツールで、コードを書かずに2群間比較から可視化までを実行できます。ここで得られる「発現変動遺伝子リスト」が、この先すべての入力になります。統計的な閾値をどう置くかで結果は変わるので、数字を動かしながら結果がどう変わるかを見ておくと、後で結果を説明するときに強くなります。
ShinyGO
「有意に変動した遺伝子が482個ありました」だけでは、生物学的な話になりません。エンリッチメント解析は、その遺伝子群にどんな機能カテゴリが偏って含まれているかを統計的に示してくれます。ShinyGO ならリストを貼り付けるだけで、GO やパスウェイの濃縮を図とともに返してくれます。ここで初めて「炎症応答が動いている」といった解釈が言えるようになります。
Reactome
最後に、自分の解析結果をパスウェイ図にマッピングします。Reactome は精緻にキュレーションされた経路データベースで、発現変動データを重ねると「経路のどこが動いていて、どこが動いていないか」が目で見て分かります。カテゴリ名の羅列だったものが、分子のつながりとして立ち上がる瞬間です。ここまで来ると、次に検証すべき分子が自然と浮かび上がってきます。
まとめ
探す → 取る → 変動を出す → 意味づける → 経路に載せる。この5本で、公共データ再解析のひと通りが手に入ります。同じ流れを別のデータセットで2〜3回まわすと、実験デザインの良し悪しを見抜く目がついてきます。3群以上を比べたい、別のエンリッチメント手法を試したい、というときは下の発展動画へ進んでください。
さらに学ぶ
関連講演動画
このテーマを、講習会やシンポジウムの講演でより深く学べます。