クリックの先へ

RDF/SPARQL でデータベースを横断して情報を集めるワークフロー

← 動画でワークフロー 一覧へ

データベースの画面を開いて、1件ずつコピーして、表計算ソフトに貼り付ける——調べる対象が数件ならそれで十分です。でも「ヒトの全キナーゼについて、構造情報と疾患との関連をまとめたい」となった瞬間、その手作業は破綻します。生命科学のデータベースの多くは RDF という形式でも公開されていて、SPARQL という言語で「問い合わせる」ことができます。このワークフローでは、UniProt を題材に、画面をクリックする世界から、まとめて問い合わせる世界へ移っていきます。

  1. 1

    UniProt

    出発点 ― 手で調べるやり方と、その限界を知る

    最初は普通に Web 画面から始めます。UniProt でアミノ酸配列や機能アノテーションをどう探すか、アクセッション番号がどういう役割を持つかを押さえておきましょう。ここで「1件ずつなら簡単に引ける」という感覚を持っておくことが大事です。次のステップで、まったく同じ情報を別のやり方で取りにいくので、その対比が効いてきます。

    UniProtを使って、タンパク質のアミノ酸配列とその機能情報を横断的・網羅的に調べる 8:03

  2. 2

    UniProt SPARQL

    同じデータベースを、画面ではなく“質問文”で引く

    ここがこのワークフローの中心です。UniProt は RDF でもデータを公開しており、SPARQL エンドポイントに問い合わせれば、条件に合うエントリを何百件でも一度に取り出せます。ステップ1で画面を何度もクリックして集めていた情報が、1本のクエリに置き換わる——この体験が、この先すべての土台になります。動画では実際のクエリの書き方と実行までを追えます。

    UniProtからSPARQLを使って情報を取得する 9:25

  3. 3

    TogoID

    UniProt の外へ出るために ― データベース間をつなぐ

    SPARQL で UniProt から情報を取れるようになると、次にぶつかるのが「他のデータベースとどうつなぐか」です。データベースごとに ID の体系が違うため、そのままでは接続できません。TogoID は生命科学系データベースの ID どうしの対応関係をたどって変換できるサービスで、UniProt の ID を PDB や遺伝子、疾患のデータベースの ID へと橋渡ししてくれます。横断利用のための、いわば継手にあたるステップです。

    TogoID ver. 2.0を使って生命科学系データベースのさまざまなIDを探索的に変換する 9:51

  4. 4

    TogoDX/Human

    つないだ先で、条件を重ねて絞り込む

    ID がつながれば、複数のデータベースにまたがった絞り込みができるようになります。TogoDX/Human は、ヒトに関する多数のデータベースを統合的に探索・俯瞰し、条件に合う対象を抽出できるツールです。「発現している組織」「疾患との関連」「構造情報の有無」といった条件を重ねていく作業を、クエリを書かずに画面上で試せます。ステップ2〜3でやったことが、どんな分析につながるのかがここで具体的に見えてきます。

    TogoDX/Human v1.2を使ってヒトのデータベースを統合的に探索、俯瞰、抽出する (基本操作編) 8:32

  5. 5

    TogoMCP

    そして今 ― クエリを書かずに、同じことを頼む

    最後に、いま起きつつある変化を見ておきます。TogoMCP を使うと、ChatGPT のような対話型 AI から生命科学データベースへ横断的に問い合わせられます。ステップ2で手で書いた SPARQL を、AI に組み立てさせるイメージです。ただし、返ってきた結果が妥当かどうかを判断できるのは、ステップ1〜4を通ってきた人だけです。仕組みを知った上で使うからこそ、この便利さが武器になります。

    ChatGPT + TogoMCP で生命科学データをデータベース横断的に検索する (実行編) 4:45

まとめ

画面をクリックする → クエリで問い合わせる → データベースをつなぐ → まとめて俯瞰する → AI に頼む。この5本を通ると、「調べる対象が増えても手作業を増やさない」というやり方が身につきます。まずはステップ2の SPARQL を、自分がよく使うタンパク質で書き換えて実行してみてください。そこが一番の分かれ目です。

さらに学ぶ