AIを活用した創薬は、単一のソフトウェアカテゴリーではありません。タンパク質アノテーションの取得、候補構造の生成、ドッキングの実行、ML学習パイプラインの作成は、それぞれ異なる作業です。有用なスタックでは、各作業に適したツールを割り当て、各工程間の受け渡しを検証可能にします。

このガイドでは、ソースに記載された機能と、提案する評価手順を区別します。以下のリソースは、公開データの取得、既知部位のトリアージ、ケモインフォマティクスのインターフェース、ホスト型の科学計算、ベンダーが説明する分子生成、論文で説明されたプログラミングエージェントを扱います。これらは、統合済みで検証されたパイプラインを構成するものではありません。

研究上の判断から始める

エージェントを選ぶ前に、判断事項を定義します。調査に値する標的はどれか、観察された結合部位のうちモデル化に値するものはどれか、設計制約を満たす分子はどれか、あるいは評価すべき予測モデルはどれか、といった点です。

標的の同定に関して、ここに挙げるリソースが主に支援するのは、タンパク質の探索と根拠の収集であり、標的が疾患の原因であることや治療標的として有望であることを自律的に確認するものではありません。分子生成については、AIDDISON Explorer がプロジェクトの基準に基づく候補作成を説明しています。分子特性予測では、データベースから取得した特性、計算で得られた記述子、モデル予測を区別し、ひとまとめのスコアとして扱わないようにします。

提案するプロジェクト概要には、生物種、タンパク質の同定情報または探索クエリ、モダリティ、利用可能な構造、測定データ、設計制約、次に行う実験上の判断を明記します。識別子、取得日、設定、未加工出力、未解決の質問を含むエビデンス台帳を維持します。化学AIスタックガイドでは各ツールの役割をより広く整理し、MCP選定ガイドでは連携方法の候補を絞り込めます。

エージェントの役割と評価については、化学AIエージェント入門を参照してください。

各リソースを実際の役割に合わせる

リソース 種類とソースに記載された役割 入力と出力 評価ゲート
UniProt MCP (cyanheads) サードパーティのタンパク質データ連携 機能クエリ、アクセッションまたは識別子 → アノテーション、対応付け、配列 生物種とアノテーションの出典を確認する
RCSB MCP (cnyambura) サードパーティの構造取得インターフェース PDB IDとエンドポイントクエリ → メタデータ、ポリマー記録、ダウンロードファイル 関連するエンティティと座標へのアクセス可否を確認する
PocketScout MCP 既知の結合部位をトリアージするサーバー 標的識別子と部位残基 → 接触根拠、リガンド履歴、保存性、解釈 部位ランキングの根拠を確認する
PubChem PUG REST MCPサーバーではなく、ホスト型HTTP API 化学識別子または構造 → 選択したレコード、特性、アッセイ概要 化合物の同一性と要求した操作を確認する
RDKit MCP Server (TandemAI) RDKitソフトウェアへのインターフェース クライアントが選択した公開ツール → ツール結果とアシスタントの応答 ツール一覧と入出力スキーマを確認する
AIDDISON Explorer ホスト型分子設計プラットフォーム 標的プロファイルと設計制約 → 生成、スコア付け、順位付けされた候補 予測の不確実性と実現可能性を確認する
Rowan ホスト型分子計算プラットフォーム 分子またはタンパク質–リガンド構造と設定 → ワークフロー固有の計算 手法の適切性と準備状況を確認する
DrugAgent (Liu et al.) 論文で説明されたマルチエージェントMLプログラミングフレームワーク タスクの説明、初期ファイル、評価器 → 実装された解決策とレポート コード、評価設計、実際の実行を監査する

MCPインターフェースはツールへのアクセスを提供しますが、それ自体が科学的予測モデルではありません。同様に、Skillは手引きであり、実行時依存関係や科学計算エンジンの代替ではありません。ホストごとに対応状況は異なります。これらの違いについてはエージェントとSkillsを参照してください。

構造を解釈する前にタンパク質の同一性を確立する

UniProt MCPは、機能ベースの検索、セクション別アノテーション、識別子の対応付け、分類情報、プロテオーム、代表配列(canonical)および任意のアイソフォーム配列に対応します。検索では既定でレビュー済みのSwiss-Protエントリーが対象となり、アノテーション出力にはキュレーションの指標と、利用可能なPubMed/ECOの根拠が保持されます。

これらの機能を使って標的の資料をまとめたうえで、同一性について明示的に判断します。遺伝子シンボルだけではワークフローの受け渡し情報として不十分です。生物種、解決されたアクセッション、選択した配列、関連するアイソフォームまたはバリアントの状況を保持してください。欠落したアノテーション項目は欠落したままにし、生物学的に否定的な結論へ置き換えないでください。

対応付けと取得では状態管理が必要です。実行中の対応付けジョブはポーリング用のチケットを返し、完了した結果には別途ページ継続情報が含まれることがあります。大きすぎるアノテーションレコードは、セクション別に追加取得する必要のある概要を返す場合があります。提案するオーケストレーションではこれらの状態を保持し、未解決のタンパク質を黙って除外せず、アクセッションごとの失敗を記録してください。

構造を取得し、既知部位を評価する

RCSB MCPは、mmCIFを含むエントリメタデータ、ポリマー詳細、構造ファイルを取得します。カスタムクエリからは、文書化されたData APIエンドポイントにアクセスできます。生物種検索ツールが返すのは説明とクエリ例であり、取得済みの構造セットではありません。そのため構造探索には、タンパク質のクロスリファレンスやPocketScoutの関連構造ツールなど、明示的な経路が必要です。

PocketScoutはgemmiを使用して共結晶化リガンド周辺の接触を解析し、複数の構造で観察されたポケットを再出現頻度に基づいて集約します。また、生物学的背景、リガンドの生物活性履歴、文献、保存性、既知のバリアントも収集します。各ツールは、未加工の情報とともに interpretation フィールドを返します。

これは既知部位に関する情報であり、新たなポケット予測ではありません。接触結果が空であることを、タンパク質に結合可能な部位がない証拠と解釈しないでください。また、部位が繰り返し観察されることを、設計仮説が実験で検証された証拠と見なさないでください。計算によるポケット予測や、構造アンサンブルに基づくアロステリック部位の検出は、現在のPocketScout機能として文書化されていません。

提案する部位選定レビューでは、構造の網羅性、リガンド接触残基、生物学的関連性、裏付けとなる文献を比較します。解釈を採用する前に未加工の根拠を確認してください。保存性の評価では、完全な多重配列アラインメントではなく、マウス、ラット、カニクイザルとの局所コンテキスト照合を用います。残基対応の不確実性がある場合は、別途レビューが必要です。

化学物質の取得とケモインフォマティクス計算を区別する

PubChem PUG RESTは、CID、名称、SMILES、InChI、InChIKeyなどの識別子を受け付けます。指定したレコードの取得、特性テーブル、アッセイ概要、同一性検索または類似性検索などの操作に対応します。出力形式は操作によって異なります。これはデータベースへのアクセスであり、新たに学習された特性モデルでも、生物活性の実験的検証でもありません。

RDKit MCPは、MCPクライアントを通してRDKit関数を公開し、ツール一覧ユーティリティ、OpenAIを活用したCLIクライアント、評価スイートを備えています。ただし、RDKit関数を完全に網羅することは表明された目標であり、網羅性が確立済みという意味ではありません。提供された抜粋には、分子の入力形式や個々のツールスキーマは列挙されていません。

そのため、提案する化学品質ゲートでは、まず利用可能なツールを確認します。確認できたスキーマで対応している場合に限って同一性チェックや記述子を要求し、その出力を別途定めた参照手順と比較してください。リポジトリのLLMJudgeはツールの利用方法や応答を評価できますが、科学的な参照確認の代わりにはなりません。RDKit AIワークフローガイドにも関連するワークフローの考え方が示されています。

段階ごとにRowanとAIDDISON Explorerを比較する

AIDDISON Explorerについてベンダーが説明するワークフローは、標的プロファイルと分子設計制約から始まります。REINVENT 4.0に基づく強化学習モデルが候補を生成し、力価、物理化学的特性、開発可能性、ADMETの各基準に照らしてスコア付けします。ADMET予測には信頼度と説明可能性に関する情報が含まれます。合成容易性スコアとSYNTHIA API経路が、実現可能性に関する検討事項を加えます。順位付けされた候補と予測特性は、CSV、SDF、RD形式でエクスポートできます。

Rowanは、ブラウザーからアクセスでき、ジョブの送信、監視、解析に使うPython APIを備えたホスト型計算環境を提供します。記載されたワークフローには、配座探索、pKaおよび溶解度予測、記述子、タンパク質調製、ドッキング、バッチおよび類縁体のドッキング、分子動力学、相対結合自由エネルギー摂動が含まれます。

設計制約に基づく分子生成と候補の優先順位付けを評価する場合は、Explorerを選択します。分子またはタンパク質–リガンド系に対する指定計算を評価する場合は、Rowanを選択します。特性に関連する機能には重複がありますが、文書化されたワークフロー上の役割は同一ではなく、相互に置き換えられるものでもありません。

ExplorerからのエクスポートをRowanに渡す方法は提案であり、相互運用性が確立されているわけではありません。試す前に、受け付けられる構造、調製要件、識別子の保持、変換後もエクスポートされた予測メタデータが残るかを確認してください。Explorerのソースからは、制限のない公開APIやローカルインストール経路の存在は確認できません。

範囲を限定したモデリング課題にDrugAgentを使う

DrugAgentの論文では、ML戦略を提案・修正するLLM Plannerと、分野固有のガイダンスに基づいて実装するLLM Instructorが説明されています。Instructorはスクリプトの読み取りと編集、コードの実行、性能または失敗のレポート返却ができます。ガイダンスは、生物学的データの取得、表現方法、分野固有モデルを扱います。

報告された研究は、PAMPA、HIV、DAVISを用いた二値分類ワークフローに関するものです。一般的な分子生成器、ドッキングエンジン、本番用の創薬システムであることは示されていません。著者は、幻覚や捏造結果のリスクなどを理由に、直接展開しないよう明確に注意しています。

提案される下流での用途は、適切な実測ラベルを整備したうえで、明確に定義された予測課題を調査することです。初期データ、固定された評価器、データ分割ルール、反復予算を用意します。確認可能なコードと実行成果物を求めてください。DrugAgentをここで取り上げたMCPリソースやプラットフォームのエクスポートに接続するには、別途エンジニアリングと評価が必要です。そうした連携が完了しているとは文書化されていません。

提案例:根拠から候補の優先順位付けへ

PocketScoutのドキュメントで例に使われているため、PDB 1M17を初期構造参照として用いる、明確に提案段階のEGFR低分子プロジェクトを考えます。ここでは結果を主張しません。

  1. 目的を定める。 ヒトEGFRプロジェクトの概要、骨格制約、希望する特性基準を入力します。設計仕様を出力します。どの基準を厳格な除外条件とし、どれを順位付けの優先条件とするか決めます。
  2. 標的を特定する。 UniProt MCPを使ってアクセッション、配列、関連アノテーションを取得します。根拠に紐付いた資料を出力します。生物種、アイソフォーム、バリアントの同一性が曖昧なままであれば中断します。
  3. 構造の根拠を確認する。 RCSB MCPからエントリーおよびポリマーのメタデータと座標を取得します。PocketScoutで、観察されたリガンド接触、関連構造、リガンド履歴、バリアントを評価します。新しいポケットを発見したとの主張ではなく、レビュー済みの部位選定理由を出力します。
  4. 候補を集めて拡張する。 PubChemで参考化合物を絞り込んで取得します。アクセス可能な場合は、設計仕様に基づく骨格重視の拡張にExplorerを利用できるか評価します。利用可能な場合は、出典識別子、予測メタデータ、合成経路情報を添えた候補構造を出力します。
  5. 化学・モデリングのゲートを適用する。 対応可能なチェックを提案する前に、RDKit MCPのツールを確認します。範囲を限定した候補セットについて、Rowanによる調製、ドッキング、選択した特性計算を評価します。受け渡しのたびに分子の同一性が保たれることを検証します。この連携はあくまで提案段階です。
  6. 候補リストをレビューする。 取得した事実、予測、ドッキング出力、未解決の懸念を分けた監査可能な表を出力します。どの内容を実験室で追跡調査する価値があるかを判断します。別個のラベル付きモデリング課題によって必要性が正当化される場合に限り、DrugAgentを加えます。

障害への対処と運用方式の選択

PubChemでは、URLの特殊文字をエンコードし、InChIまたはSDF入力には文書化されたPOST処理を使用し、リクエスト制限と動的なスロットリングに従い、上限を設けた再試行を行います。大規模なコレクションを、無制限のレコード単位リクエストの連続にしてはなりません。

MCPツールでは、部分的な失敗、ページネーション、非同期状態を保持します。RCSBのダウンロードはローカルパスを返すため、下流のプロセスが実際にそのファイルへアクセスできることを確認してください。座標が利用できない場合、ラベルが欠落している場合、計算に失敗した場合は、アシスタントに値を捏造させず、記録された欠落として扱います。

ローカル運用にも固有の要件があります。PocketScoutはPython 3.11以降を必要とし、Alphaと表示されています。RCSBのプロジェクトメタデータはPython 3.13以降を必要とします。UniProtのREADMEでは前提条件としてBun v1.3.0以降と記載されていますが、パッケージメタデータではBun >=1.4.0が必要です。デプロイ前に選択したパッケージのメタデータを確認してください。一般的なMCP対応は、特定のホストとの互換性を証明するものではありません。

PocketScoutとTandemAI RDKitにはMITライセンステキストが付属し、UniProt MCPはApache-2.0です。RCSBのREADMEはMITを宣言していますが、別個のライセンステキストは提供されていません。DrugAgentの論文にはコードへのリンクがありますが、利用可能なリポジトリの抜粋からはセットアップ方法もコードのライセンスも確認できません。Rowan、Explorer、PubChemのサービス利用情報からは、ローカルで利用可能な実装コードやリポジトリライセンスの有無は確認できません。ソフトウェア、上流データ、ホスト型サービスの利用条件は、それぞれ別に検討する必要があります。

読者向けチェックリスト

  • オーケストレーションを始める前に、研究上の判断事項と中止条件を定義する。
  • 生物種、タンパク質配列、構造エンティティ、化合物の同一性を解決する。
  • 取得レコード、計算結果、予測を別の列に分ける。
  • PocketScoutの根拠とRDKit MCPのツールスキーマを確認する。
  • 提案する受け渡しの各段階で、ファイルへのアクセスと形式要件を確認する。
  • 欠落データ、失敗したジョブ、設定、予測の不確実性を記録する。
  • 順位付けの前に、構造上の前提、アッセイの背景、モデルの適用可能性を確認する。
  • 活性、安全性、合成に関する主張には実験での追跡確認を求める。

関連するガイドも参照してください:タンパク質・構造生物学のAIワークフロー:UniProt・RCSB PDB・Agent。

出典

主な根拠は、DrugAgent論文、PocketScout、UniProt MCP、RCSB MCP、RDKit MCPのプロジェクトドキュメント、PubChem仕様書と運用チュートリアル、およびRowanとAIDDISON Explorerの公式製品説明です。プラットフォームの説明はベンダーの主張であり、独立した検証ではありません。