チャットボットがエージェントになると何が変わるのか?

有用な区別は、システムが単に回答を提案するだけなのか、タスクに対して行動し、結果を確認し、次の行動を決められるのかという点です。分子動力学プロトコルを説明するのは会話型の支援です。準備ツールを選び、シミュレーションを開始し、解析を依頼するのはエージェントのワークフローです。

ここでいう自律研究とは、委任可能な能力の幅を意味し、無人で科学的発見を行うという約束ではありません。研究者は、仮定、実行権限、結論に対する決定権を保持しながら、情報検索、計画、計算、実装を委任できます。自律性を高めるなら、科学的チェックを減らすのではなく、タスクの取り決めをより明確にすべきです。

本ガイドでは、化学および生物医学研究のプロジェクト8件を取り上げます。モデルとインフラのより広い違いについては、化学AIスタックガイドおよびMCP、Skills、エージェント、APIガイドを参照してください。分野横断型のワークフローと権限評価については、別途エージェントとSkillsのガイドを参照してください。

構成要素:モデル、ツール、メモリ、計画、実行

エージェントのアーキテクチャは、役割分担として捉えると理解しやすくなります。

  • **LLM:**目的を解釈し、手順を提案し、結果を説明します。そのテキスト自体は計算結果でも測定結果でもありません。
  • **ツール:**記録の検索、構造の構築、特性の予測、シミュレーションの実行、ファイルの操作を行います。科学的な適用範囲は基盤となる手法に由来します。
  • **メモリ:**過去のタスクの解決策やワークフローテンプレートなど、再利用可能な情報を保持します。再利用する前に、出典と処理履歴を確認し、内容を点検する必要があります。
  • **計画:**目的を、ツールの選択、パラメータ、依存関係へと具体化します。代替計画を探索するフレームワークもあります。
  • **実行:**アクションを実行し、次の判断に役立つ成果物、エラー、レポートを返します。

これらの要素は相互に置き換えられる製品ではありません。オーケストレーションフレームワークは単体の特性モデルではありません。ラッパーやツールインターフェースは、別のプログラムの機能を公開するものであり、そのプログラムに取って代わるものではありません。ホスト型モデルAPIが提供するのはモデルへのアクセスであり、ローカルの科学計算環境ではありません。

公式のAgent Skills形式は、指示を SKILL.md にまとめ、任意で補助リソースやスクリプトを含められます。ホスト側の対応状況は異なり、指示を読み込んでも実行依存関係はインストールされません。したがって、ChemGraphのSkillsやSTELLAのワークフローテンプレートは、追加の自律研究者ではなく、補助手順として捉えるべきです。

MCPは、ホスト、クライアント、サーバー間のコンテキスト交換を定義します。ChemGraphはMCPツールの提供と利用の両方を説明しています。現在のプロトコル概要から、すべての旧版プロジェクト実装と現行ホストとの互換性が確認できるわけではありません。

ツールアクセス層の仕組みと評価については、化学分野のMCPを参照してください。

研究上の役割で比較する8つのプロジェクト

表は情報源で裏付けられた役割を示すものであり、順位付けでも、相互運用性をテストした一覧でもありません。評価の入口は提案です。

プロジェクト 情報源に記載された役割と出力 推奨する評価の入口と主な制約
ChemGraph 分子構築、ASE計算、解析、報告をオーケストレーションします。成果物には構造、軌跡、スペクトル、結果が含まれる場合があります single_agent から始めます。利用できる計算器は環境によって異なり、EMTは設定確認向けで、一般的な高精度化学計算向けではありません
MDCrow 分子動力学の準備、OpenMMの実行、解析、科学情報検索を調整します 小規模なシミュレーションとRMSDのワークフローを確認します。提供された根拠から、網羅的な設定や出力形式は確認できません
ChatMOF MOFに関するリクエストを、検索、特性予測、構造生成ツールに振り分けます 検索から始めます。ローカル予測にはモジュールのセットアップが必要で、生成にはさらにGRIDAYが必要です
SciAgents グラフのコンテキストと専門エージェントを使い、構造化された仮説と拡張研究提案を生成します サンプリングされたグラフ経路と、それから得られた提案を確認します。出力は引き続き仮説であり、追跡調査が必要です
ChemAgent (Gerstein Lab) 化学的推論問題を分解し、再利用可能なPlan、Execution、Knowledgeのメモリを検索します メモリ構築後に、文書化されたSciBench由来のタスクを再現します。インストール手順は不完全です
ChemAgent (AI4Chem) 化学・材料ツールの学習と木探索による計画を扱うCheMatAgent論文に関連付けられたフレームワークです ツール選択とパラメータ入力を調べます。デプロイ要件とチェックポイントの入手可能性は確認されていません
STELLA マネージャー、開発、批評の役割、再利用可能なテンプレート、任意のツール作成を使って、生物医学文献、データベース、解析を調整します 根拠に基づくランキングまたは解析タスクを確認します。ローカル実行にはOpenRouterへのアクセスと、タスクに応じたリソースが必要です
DrugAgent (Liu et al.) 創薬機械学習ワークフローの実装と評価を目的とする、論文記載のPlanner–Instructor協調方式です 方法論を再現の出発点として使います。提供されたリポジトリの根拠からは、実行可能なセットアップやコードライセンスを確認できません

名前の似た項目が2つあるため、注意が必要です。Gerstein Lab ChemAgentはメモリを活用した化学的推論を研究します。一方、AI4Chemリポジトリは、ChemAgentフレームワークをCheMatAgent論文に関連付けています。名称が同じでも、機能が同等とは限りません。

科学タスクに合ったエージェントを選ぶ

計算化学では、オーケストレーションと、実際に計算を行うエンジンを分けて考えます。ChemGraphは構築・計算・報告を広く扱うレイヤーを提供し、MDCrowは分子動力学に特化しています。必要な計算と成果物に基づいて選び、そのうえで必要なエンジンと設定が利用できるかを確認してください。

材料探索では、ChatMOFがMOFの検索、予測、生成を扱います。それに対し、SciAgentsはグラフ上の関係から生物模倣型の材料仮説を展開します。生成構造と研究提案が答える問いは異なります。前者は計算上の候補を、後者は調査すべき方向性を提示します。

分子設計では、成果物が構築された構造、予測された特性、または目標特性を狙う候補のどれなのかを定めてください。ChatMOFは、特性を目標とするMOF生成を明示しています。ChemGraphの分子構築を、暗黙のうちに汎用逆設計機能へと拡張して解釈してはなりません。

文献研究では、STELLAが生物医学検索と根拠重視のワークフローを提供し、SciAgentsは仮説形成の中で検索した情報を利用します。ChemGraphもPDF/テキスト検索ワークフローを説明し、MDCrowの論文は文献とデータベースの検索について記載しています。流暢な要約だけで納得せず、追跡可能な根拠情報を求めてください。

創薬におけるDrugAgentの役割は機械学習プログラミングであり、実験室での創薬ではありません。その論文ではPAMPA、HIV、DAVISの分類タスクを研究しています。STELLAは生物医学的な優先順位付けとバーチャルスクリーニングのツールを説明し、ChemGraphには依存関係が指定されたドッキングワークフローがあります。これらの段階は相互に置き換えられるものでも、実験的検証の代わりになるものでもありません。

複数エージェントが役立つ場面と、その役割の意味

役割を分割でき、受け渡しを確認できる場合、複数エージェントが役立ちます。SciAgentsでは、概念の明確化、提案の作成、改善、批評を異なる役割に割り当てます。自動化されたワークフローには、計画と新規性の確認も加わります。STELLAは管理、開発、批評を分け、任意でツール作成も行います。DrugAgentは戦略探索と、領域知識に基づく実装を分担します。

重要なのはエージェントの数ではなく、各境界を越えてどのような根拠が渡されるかです。プランナーは明示された入力と制約を引き渡すべきです。実行役は成果物と失敗情報を返すべきです。批評役は、単に回答をより自信ありげに書き換えるのではなく、裏付けのない仮定を指摘すべきです。

評価では、1つのツール手順で十分なら、単一エージェントから始めるのが望ましいでしょう。パラメータの独立した確認や代替実装の比較など、検証可能な利点がある場合に限って専門役を追加します。エージェント同士が一致しても、それを独立した科学的確認とみなしてはなりません。

提案例:範囲を限定した分子動力学評価

**これは提案する評価であり、完了済みのテストではありません。**MDCrowの文書化されたタンパク質シミュレーションとRMSDの例を出発点とし、最終回答だけでなく、検証可能なワークフローを求めます。

**入力:**研究者が承認したタンパク質識別子または構造、温度、意図的に短く設定した実行時間、要求するRMSD解析、隔離されたソフトウェア環境、計算資源の上限です。例で確認できない準備方法やシミュレーションの選択肢は研究者が指定します。

  1. **計画:**準備、実行、解析の手順一覧を求めます。判断点:必要な設定は明示されていますか。それともエージェントが未確認のデフォルト値を提示していますか?
  2. **承認:**実行前に構造と提案された設定を確認します。パラメータが曖昧、または裏付けがない場合は、置き換えを許可せず、停止して問題を解決します。
  3. **実行:**範囲を限定した実行のみを許可します。生成された入力、実行ログ、利用可能なシミュレーション成果物を保存し、実際の形式はローカルで確認します。
  4. **解析:**対象原子の選択と参照構造を明記したうえで、時間に対するRMSDを求めます。判断点:解析方法は科学的な問いに合致していますか?
  5. **監査:**要約を保存された根拠と照合します。成果物の欠落、実行エラー、裏付けのない結論は、別々に分類します。

**要求する出力:**パラメータ記録、実行状態、成果物一覧、RMSD解析、未解決の仮定に関する簡潔な説明です。これは評価上の取り決めであり、MDCrowがこれらすべてを自動生成するという主張ではありません。

この条件で短時間の実行に成功しても、確認できるのはワークフローが完了したことだけであり、サンプリングが十分だったことや生物学的結論を示したことにはなりません。その後の機械学習ワークフロー開発にDrugAgentを接続するなら、それは提案段階の統合であり、データ、ラベル、評価規則、受け渡し方法を別途定義する必要があります。ここでは、そのような相互運用性は確認されていません。

失敗への対処と科学的な限界

失敗はタスクの範囲を絞るために使い、制限のない再試行を促す材料にしてはなりません。

  • **エンジンまたは依存関係が不足:**該当する段階を止め、不足しているものを特定します。承認なしに、科学的な役割の異なる計算器で代用してはなりません。
  • **不正なパラメータまたは構造:**再試行前にツール呼び出しと入力成果物を確認し、失敗した試行も保存します。
  • **引用がない、または根拠が矛盾:**作り上げた説明で整合させず、未解決の根拠項目として返します。
  • **計算または解析の失敗:**実行失敗と、好ましくない科学的結果を区別します。体裁の整ったレポートでも、計算が行われていなければ補うことはできません。
  • **安全でないファイル操作またはコード操作:**審査と隔離を必須にします。ChemGraphは、ワークスペースのshellアクセスがワークスペース内に制限されないと明記しています。

科学的レビューでは、識別情報、単位、計算設定、収束性、解析の定義、手法が結論を支持できるかを確認してください。提案段階の機械学習評価では、データの出典と処理履歴、分割方法、ラベルの扱いも確認します。再現可能な化学AIガイドでは、より広い枠組みを紹介しています。

メモリやテンプレートに関しては、結果を再利用可能な指針として登録すべきかという判断も必要です。出典と適用範囲が明確で、内容を点検した記録だけを登録することを推奨します。STELLAは、モデルの確率的性質や文献索引の変化によってランキングが変わる可能性があると述べています。SciAgentsの新規性評価は、検索結果に依存する判断にとどまります。DrugAgentの著者は、捏造された結果が後続作業を誤らせるおそれがあるため、創薬パイプラインに直接導入しないよう明示的に警告しています。

選定チェックリストと未解決のセットアップ上の疑問

プロジェクトを選ぶ前に、次の点を確認してください。

  • 目指す出力は、回答、仮説、構造、シミュレーション成果物、実装済みの機械学習ソリューションのどれですか?
  • 必要なエンジン、モデル、リソース、認証情報は文書化されていますか?
  • 説明文の要約とは別に、ツールのパラメータや出力を確認できますか?
  • 実行権限と停止条件は明確ですか?
  • 有用な根拠を上書きせずに、失敗した試行を保存できますか?
  • 科学的な仮定と下流での利用を誰が承認しますか?
  • コード、重み、データ、サービス条件をそれぞれ評価していますか?

文書の不足は選定に直接影響します。ChatMOFのオンラインデモは検索に重点を置いており、一般的な予測・生成の試用ではありません。Gerstein Lab ChemAgentでは、image/img設定とXagent/XAgentパスの不整合を、再現前にコードと照らし合わせて解決してください。提供されたREADMEにはAI4Chemのデプロイ手順がありません。STELLAの現行READMEとリンク先のarXiv論文では説明の内容が異なるため、再現時にはどちらのスナップショットに従うかを明示してください。

SciAgentsにはライセンスメタデータの不一致もあります。ライセンスファイルにはApache License 2.0が記載されている一方、パッケージメタデータではMITと宣言されています。再利用または再配布の前に解決してください。リポジトリが公開されていることだけでは、ライセンスの有無や内容は確定しません。異なるレイヤーについては、ソフトウェア、重み、データのライセンスガイドを参照してください。

関連するガイドも参照してください:化学AIエージェント比較:機能・コード公開状況・研究上の範囲。

出典

主な機能に関する情報源は、ChemGraph README、MDCrow READMEと論文、ChatMOF README、SciAgents READMEです。

メモリとツール学習に関する記述は、Gerstein Lab ChemAgent READMEと論文、およびAI4Chem READMEとCheMatAgent論文に基づいています。生物医学のオーケストレーションはSTELLA READMEに、DrugAgentのアーキテクチャとデプロイに関する注意事項はその論文に基づいています。

インフラに関する区別は、公式のMCPアーキテクチャ概要とAgent Skillsの概要に基づいています。SciAgentsのライセンスの不一致は、そのライセンスファイルとパッケージメタデータで確認できます。