配列では見つからない相手を、立体構造で探し出す実践ワークフロー
← 動画でワークフロー 一覧へアミノ酸配列を比べても引っかからない。でも立体構造を見ると、驚くほどよく似ている——そんな「遠縁のタンパク質」を掘り当てるのが構造検索ツールの真骨頂です。AlphaFold の登場で予測構造は2億件を超え、いまや構造から探すことが現実的な選択肢になりました。このワークフローでは、俯瞰する → 探す → 並べる → 絞り込む、の4ステップで解像度を上げながら目的のタンパク質に迫っていきます。
ワークフロー
AFDB Clusters
いきなり検索を始める前に、地図を見ておきます。AlphaFold Protein Structure Database(AFDB)には約2億1400万件の予測構造が登録されており、AFDB Clusters はそれを構造ベースでクラスタリングしたものです。自分の興味あるタンパク質がどんな仲間に囲まれているかが分かると、この先どの方向を掘るべきかの当たりがつきます。動画ではメチシリン耐性黄色ブドウ球菌(MRSA)の耐性遺伝子 mecA がコードする PBP2a を例に、耐性の鍵となる構造がどのクラスターに属するのかを追っていきます。
Foldseek
地図で当たりをつけたら、次は具体的な候補リストをつくります。Foldseek は立体構造を「3Di 構造アルファベット」という文字列に変換することで、構造検索を配列検索なみの速度で実行できるツールです。UniProt の構造ビューアから直接呼び出せる連携機能があるので、気になるタンパク質のエントリを開いたその場で類似構造検索まで進めます。ステップ1で見えた方向性が、ここで「比較すべきタンパク質のリスト」という具体的な形になります。
FoldMason
候補が集まったら、2つずつ見比べるのはやめて一気に並べます。FoldMason は多数の立体構造を高速に多重構造アライメント(MSTA: multiple structural alignment)し、系統関係や構造類似性をまとめて可視化できるツールです。集めた候補が本当に一つのファミリーなのか、それともいくつかのグループに分かれるのかがここで判断できます。同時に「どの部分がグループ共通で保存されているか」も見えてきます——これが次のステップの検索キーになります。動画では緑膿菌のリパーゼとその触媒トライアド(触媒反応に関与する3つのアミノ酸残基からなる構造)を例に解説しています。
Folddisco
最後に、粒度をもう一段下げます。Foldseek がタンパク質全体の構造を比べるのに対し、Folddisco は局所的な三次元配置=モチーフの検索に特化したツールです。ステップ3のアライメントで浮かび上がった共通モチーフを検索キーにすれば、全体構造ではもはや似ていない、さらに遠縁のタンパク質にまで手が届きます。動画ではマウスの Egr1 がもつ C2H2 型ジンクフィンガーを例に、モチーフ検索の実際が示されています。
まとめ
この4ステップは「全体を俯瞰する → 個別に探す → 並べて比べる → 部分に絞る」という、徐々に解像度が上がっていく流れになっています。どこから入っても構いませんが、順番にたどると、なぜ Folddisco のような部分モチーフ検索が必要になるのかが自然に分かってきます。手元のタンパク質で同じ順路を歩いてみてください。