RDF/SPARQL でデータベースを横断して情報を集めるワークフロー
← 動画でワークフロー 一覧へデータベースの画面を開いて、1件ずつコピーして、表計算ソフトに貼り付ける——調べる対象が数件ならそれで十分です。でも「ヒトの全キナーゼについて、構造情報と疾患との関連をまとめたい」となった瞬間、その手作業は破綻します。生命科学のデータベースの多くは RDF という形式でも公開されていて、SPARQL という言語で「問い合わせる」ことができます。このワークフローでは、UniProt を題材に、画面をクリックする世界から、まとめて問い合わせる世界へ移っていきます。
ワークフロー
公開から年数が経っている動画です。ツールの画面や手順が現行版と異なる場合があります(更新予定)。
UniProt
最初は普通に Web 画面から始めます。UniProt でアミノ酸配列や機能アノテーションをどう探すか、アクセッション番号がどういう役割を持つかを押さえておきましょう。ここで「1件ずつなら簡単に引ける」という感覚を持っておくことが大事です。次のステップで、まったく同じ情報を別のやり方で取りにいくので、その対比が効いてきます。
UniProt SPARQL
ここがこのワークフローの中心です。UniProt は RDF でもデータを公開しており、SPARQL エンドポイントに問い合わせれば、条件に合うエントリを何百件でも一度に取り出せます。ステップ1で画面を何度もクリックして集めていた情報が、1本のクエリに置き換わる——この体験が、この先すべての土台になります。動画では実際のクエリの書き方と実行までを追えます。
TogoID
SPARQL で UniProt から情報を取れるようになると、次にぶつかるのが「他のデータベースとどうつなぐか」です。データベースごとに ID の体系が違うため、そのままでは接続できません。TogoID は生命科学系データベースの ID どうしの対応関係をたどって変換できるサービスで、UniProt の ID を PDB や遺伝子、疾患のデータベースの ID へと橋渡ししてくれます。横断利用のための、いわば継手にあたるステップです。
TogoDX/Human
ID がつながれば、複数のデータベースにまたがった絞り込みができるようになります。TogoDX/Human は、ヒトに関する多数のデータベースを統合的に探索・俯瞰し、条件に合う対象を抽出できるツールです。「発現している組織」「疾患との関連」「構造情報の有無」といった条件を重ねていく作業を、クエリを書かずに画面上で試せます。ステップ2〜3でやったことが、どんな分析につながるのかがここで具体的に見えてきます。
TogoMCP
最後に、いま起きつつある変化を見ておきます。TogoMCP を使うと、ChatGPT のような対話型 AI から生命科学データベースへ横断的に問い合わせられます。ステップ2で手で書いた SPARQL を、AI に組み立てさせるイメージです。ただし、返ってきた結果が妥当かどうかを判断できるのは、ステップ1〜4を通ってきた人だけです。仕組みを知った上で使うからこそ、この便利さが武器になります。
まとめ
画面をクリックする → クエリで問い合わせる → データベースをつなぐ → まとめて俯瞰する → AI に頼む。この5本を通ると、「調べる対象が増えても手作業を増やさない」というやり方が身につきます。まずはステップ2の SPARQL を、自分がよく使うタンパク質で書き換えて実行してみてください。そこが一番の分かれ目です。
さらに学ぶ
関連講演動画
このテーマを、講習会やシンポジウムの講演でより深く学べます。