エージェントの呼称ではなく、科学的な役割を比較する
化学エージェントを選ぶときは、必要な成果物から考え始めましょう。シミュレーション軌跡、MOF 構造、筋道を示した化学推論の解答、仮説、あるいは実装済みの機械学習実験などです。これらは異なる成果物であり、単一の順位付けでは説明よりも見えにくくなる点のほうが多くなります。
以下の8プロジェクトは、根拠の詳しさにも差があります。ソフトウェアとセットアップ手順を提供するものもあれば、研究コードは公開されていてもデプロイ手順が不完全なものもあります。DrugAgent はコードにリンクした論文で説明されていますが、提供されたリポジトリページから、利用可能な実装内容が存在するとは確認できません。リポジトリが見えることだけでは、適用可能なオープンソースライセンスの証明にはなりません。
本ガイドでは、情報源に記載された機能を比較し、評価手順を提案します。実機での実行や科学的検証の結果を報告するものではありません。概要については化学分野の AI エージェントを、アーキテクチャの違いについてはエージェントと Skillsを参照してください。
調整する作業内容でシステムを分類する
情報源からは、次の4つの実用的なカテゴリーが見えてきます。
- **計算ワークフローのオーケストレーション:**ChemGraph はリクエストを分子構築、計算器、解析、レポート作成につなぎ、MDCrow は分子動力学に特化します。
- **材料分野向けの専用ツール:**ChatMOF は専用モジュールを通じて、MOF の検索、予測、生成タスクを処理します。
- **推論と仮説の展開:**SciAgents はグラフに基づく仮説を生成し、ChemAgent (Gerstein Lab) は記憶を活用する化学推論を研究します。
- **ツール学習と計算研究:**ChemAgent (AI4Chem) は計画とツール使用の訓練を研究し、STELLA は生物医学研究ツールを調整し、DrugAgent は創薬の機械学習実装を開発します。
これらはフレームワークであり、相互に置き換えられる単体の予測モデルではありません。科学的な出力は、基盤となるエンジン、モデル、データベース、タスク定義に左右されます。
Skills とテンプレートは別の層です。ChemGraph Skills は指示を提供し、STELLA テンプレートは再利用可能なワークフローを定義します。どちらも追加の自律型科学者として数えるべきではありません。指示を読み込んでも実行依存関係はインストールされず、ホストによる対応状況も異なります。同様に、ホスト型インターフェースがあるからといって、すべてのローカル機能をオンラインで利用できるとは限りません。化学 AI スタックでは、各層の関係を説明しています。
8つのエージェント:入出力とツールの範囲
本比較は2026-10-06(UTC)に取得した資料に基づきます。表は役割を説明するもので、精度の比較ではありません。各プロジェクトの背景については、リソースのリンクを参照してください。
| リソース | 科学的な役割と入力 | 情報源に記載された出力 | 重要なツールと依存関係 |
|---|---|---|---|
| ChemGraph | 化学リクエストと計算設定。専用ワークフローでは文書またはリガンド/受容体情報を受け付ける | 構造、計算結果、軌跡、スペクトル、レポート | LangGraph、ASE、RDKit、MCP。利用できる計算器はインストール済みエンジンに依存 |
| MDCrow | タンパク質識別子や希望条件を含む自然言語の MD タスク | シミュレーションの実行と、時間経過に伴う RMSD など指定された解析。完全なファイル形式は不明 | LangChainによる調整、OpenMMによるシミュレーション、設定済み環境、LLM プロバイダーのキー |
| ChatMOF | テキスト形式の MOF クエリと希望する特性 | 検索情報、特性予測、生成構造 | タスクモジュールのセットアップ。生成には GRIDAY も必要。オンラインデモは検索に重点を置く |
| SciAgents | キーワードまたはサンプリングされた知識グラフのパス | 構造化された仮説 JSON と、批評を加えて展開された提案 | GraphReasoning、グラフと埋め込みファイル、OpenAI および Semantic Scholar API。自動ワークフローでは AG2 を使用 |
| ChemAgent (Gerstein Lab) | 複数段階の化学推論問題 | 記憶を活用した解答と保存されたタスク経験 | 記憶の構築とモデル設定。完全なインストール手順は不足 |
| ChemAgent (AI4Chem) | 化学・材料タスクとツール呼び出しパラメーター | ツールを利用した回答または予測。具体的なスキーマは不明 | ChemToolBench と化学・材料ツール群。デプロイ要件は確認されていない |
| STELLA | 生物医学的な目的。ケーススタディでは過去のスクリーニング結果も使用 | 根拠に基づく遺伝子ランキングまたは酵素変異体の提案。ケースのスクリプトは CSV とテキストを保存 | ローカルの OpenRouter キー。任意の文献・検索サービスと別途提供される生物医学リソース |
| DrugAgent (Liu et al.) | タスクの説明、スターターファイル、評価器 | 実装された ML ソリューション、性能または失敗のレポート、実験提出ファイル | ドメイン文書を利用する Planner/Instructor ワークフロー。実装へのアクセスとセットアップは未確認 |
ChemGraph は MCP ツールの提供と利用を明示的に記載しています。それは、他の7プロジェクトがすべて同じプロトコルインターフェースや現行クライアントをサポートする証拠ではありません。プロジェクト間の接続を提案する場合は、インターフェースを調査し、別途テストする必要があります。
コード、ライセンス、再現上の障壁
論文のスナップショットとリポジトリのリビジョンは、分けて記録してください。最新の README が元の論文にない機能を説明していることもあり、論文にコード利用可能と記載されていても、実行環境が完全とは限りません。
| プロジェクト | ここで確認できる論文または研究のスナップショット | コード/ライセンスの根拠 | 主な再現上の障壁 |
|---|---|---|---|
| ChemGraph | README は Communications Chemistry の第9巻、論文番号33 (2026) を引用 | リポジトリのコードと文書化された実行入口。Apache-2.0 | 計算器の依存関係とワークフロー固有のインフラを一致させること |
| MDCrow | arXiv:2502.09565v1 | リポジトリコードとインストール手順。MIT | OpenMM 環境、プロバイダー連携、タスク設定 |
| ChatMOF | README は Nature Communications 15, 4705 (2024) を引用 | パッケージ設定と CLI。MIT | デモへのアクセスだけではなく、ローカルの予測・生成モジュールと GRIDAY |
| SciAgents | README は Advanced Materials、論文番号2413523 (2024) を引用 | Notebook コード。Apache-2.0 のライセンステキストと MIT のパッケージ分類子が矛盾 | 外部グラフ資産、API、未解決のライセンスメタデータ |
| ChemAgent (Gerstein Lab) | arXiv:2501.06590v1 | 研究コードを公開。Apache-2.0 バッジだけではライセンステキストを確認できない | インストール欄がプレースホルダーで、事前の記憶構築が必要 |
| ChemAgent (AI4Chem) | ChemistryAgent に関連する CheMatAgent、arXiv:2506.07551v2 | リポジトリのフレームワークとデータセットの場所を記載。ライセンス不明 | デプロイ手順がなく、チェックポイントも未確認 |
| STELLA | arXiv:2507.02004v1。現行 README は拡張版の bioRxiv 発表にもリンク | コードと実行入口を記載。Apache-2.0 | リソースが別途配布され、文献やモデルの出力が変化する |
| DrugAgent | arXiv:2411.15692v2 | 論文は匿名のリポジトリにリンク。提供されたページには実装ファイルもコードライセンスも掲載されていない | コードへのアクセス、環境、評価器の再現方法を確認すること |
SciAgents のライセンス矛盾は、再配布や改変の前に解決する必要があります。都合のよいほうのラベルを選ぶのではなく、対象コードのスナップショットを調べ、確認を求めてください。STELLA の README とパッケージメタデータにも異なるバージョンラベルがあるため、どちらか一方を統一されたリリース識別子として使用しないでください。
コードライセンスがモデルの重み、データセット、API、ホスト型アクセスまで自動的に対象にするわけではありません。たとえば ChemGraph の README は、MACE-Polar の重みに適用される ASL 条項を別途示しています。この違いについてはソフトウェア、重み、データのライセンスを参照してください。
2つの ChemAgent プロジェクトを区別する
ChemAgent (Gerstein Lab) は、化学問題を解くための再利用可能な記憶を研究します。タスクの分割、実行、関連付け、振り返りは、Plan Memory、Execution Memory、Knowledge Memory と連携します。文書化された実験では、SciBench 由来の atkins、chemmc、matter、quan データセットを使用します。創薬と材料科学は論文で将来の可能性として挙げられており、確立済みのエンドツーエンド・ワークフローではありません。
再現の第一歩は、記憶の由来と構築方法の確認です。README では Knowledge Memory の名称が image と img の間で揺れ、パス中の Xagent と XAgent も一貫していません。実験の実行前に、選択したコードと照合してください。失敗後の改良と評価の有効化は、別個の制御項目です。
ChemAgent (AI4Chem) は ChemistryAgent リポジトリの ChemAgent フレームワークで、CheMatAgent という論文に対応します。研究の重点は、外部ツールの選択、パラメーターの入力、実行にあります。HE-MCTS は計画の最適化と実行を分け、ChemToolBench は訓練と評価を支援します。これは Gerstein Lab の記憶システムではなく、簡潔な README もすぐ実行できるデプロイ環境を裏付けるものではありません。
メモ、依存関係の記録、引用では、リポジトリと論文識別子を併記してください。名前が同じというだけでは区別できません。
研究段階と用途に応じて選ぶ
計算化学では、汎用的な分子・計算器のオーケストレーションが必要か、専用の MD ワークフローが必要かを最初に決めましょう。それぞれ ChemGraph と MDCrow が候補になりますが、どちらも手法選択の代わりにはなりません。
材料探索では、MOF 固有の検索、予測、生成に ChatMOF が適し、バイオインスパイアード材料の仮説展開には SciAgents が適します。ChemAgent (AI4Chem) は化学・材料分野のツール学習を研究する際の候補ですが、デプロイ経路の確立度は低めです。
文献研究では、STELLA が生物医学検索と根拠重視のワークフローを提供し、SciAgents は検索を使って仮説を批評します。検索範囲が広くても、網羅性が保証されるわけではありません。
創薬では、標的や変異体の優先順位付けと ML プログラミングを区別してください。STELLA は生物医学的な優先順位付けワークフローを説明し、DrugAgent は PAMPA、HIV、DAVIS の二値分類ケーススタディで、ML の実装と評価を研究します。著者は、これをそのままパイプラインに導入しないよう明示的に注意しています。創薬の AIでは、より広いワークフローの背景を説明しています。
学習目的なら、アーキテクチャと文書化された小規模な例を調べます。再現実験なら、タスクを固定し、成果物を保存します。実際の研究に使うなら、出力を先に進める前に、手法のレビュー、根拠の追跡可能性、独立した確認を求めてください。これは適性を判断するための提案基準であり、準備完了の認証ではありません。
材料研究の段階別選定については、材料科学のAIワークフローを参照してください。
提案例:過大な主張を避けて MD アシスタントを評価する
具体的な試験案として、README にあるタンパク質 1ZNI、300 K、0.1 ps のシミュレーション、時間経過に伴う RMSD の計算を含むタスクを用いて MDCrow を評価できます。これはワークフローの確認であり、科学的に十分なサンプリング研究ではありません。
- **入力を定義する:**タンパク質識別子、使用する構造、温度、継続時間、RMSD の要求を記録します。実行前に、研究者が許容される準備、力場、解析方法を指定します。
- **前提条件を確認する:**文書化された環境とプロバイダーの設定に従います。言語インターフェースが提供すると想定せず、必要なシミュレーションツールが利用可能か確認します。
- **判断内容を調べる:**実行を受け入れる前に、構造の準備、シミュレーション設定、原子選択、アラインメントの判断を調べます。
- **出力を収集する:**利用可能な設定記録、実行ログ、RMSD 結果を要求します。成果物が得られなければ試験は失敗として扱います。提供された README では、それらの形式が完全には明らかにされていません。
- **継続の是非を判断する:**記録された設定と解析を、研究者が用意した参照ワークフローと比較します。実行に成功したことと、科学的に意味のあるダイナミクスが得られたことを分けて考えます。
後続の DrugAgent 研究では、別途キュレーションしたデータセット、スターターファイル、評価器を使い、ML 実装を調べることが考えられます。MDCrow から DrugAgent への自動引き継ぎや、テスト済みの相互運用性は確認されていません。まずコードへのアクセスを確認し、データ契約を定義してください。再現可能な化学 AIでは、このような評価に必要な記録について説明しています。
失敗と科学的な限界に対処する
再試行の前に失敗を分類してください。エンジンの不足、資産へのアクセス不能、プロバイダー資格情報の不足は環境の失敗です。不正なツールパラメーターはオーケストレーションの失敗であり、計算の未収束や不適切な手法は科学的な失敗です。失敗時の入力とログを保存し、該当する層を修正してください。成功したように見える回答を得るため、エージェントに別の手法へ黙って切り替えさせないでください。
プロジェクトごとに確認基準を設けます。ChemGraph の EMT 例はセットアップ確認用であり、一般的な高精度化学の評価ではありません。アクションレビューがあっても、ChemGraph のワークスペースシェルはワークスペース内に制限されていません。ChatMOF のオンライン検索デモは、ローカルの予測や生成の代わりにはなりません。SciAgents が提案する機構は仮説のままです。STELLA は、モデルの確率性や文献インデックスの更新によって遺伝子の順位が変わり得ると注意しています。特に、結果の捏造に関する論文の懸念を踏まえ、DrugAgent の性能報告は実際の評価器の成果物と照合してください。
比較実験では、同等の入力、文書化された手法、固定したデータスナップショット、明示的な失敗分類を使います。推論ベンチマーク、検索タスク、シミュレーション完了を1つのスコアにまとめないでください。エージェントやツールの数が多いこと、提案が長いことは、科学的結論の優位性を示すものではありません。
読者向けチェックリスト
- 必要な成果物と研究段階を特定する。
- リポジトリのリビジョンと論文のバージョンを両方記録する。
- コードの内容、インストール手順、必要な資産を確認する。
- コード、重み、データのライセンス上の不確実性を個別に解決する。
- 入力、単位、手法の選択、合格基準を指定する。
- ツール呼び出し、設定、ログ、未加工の出力を保存する。
- 根拠不足や科学的な失敗に対する停止条件を設ける。
- 引き継ぎを試みる前に、統合案を確認する。
情報源
機能に関する主な情報源は、次の公式 README です:ChemGraph、MDCrow、ChatMOF、SciAgents、STELLA。
ChemAgent の違いは、Gerstein Lab README と論文、および AI4Chem README と CheMatAgent 論文 に基づいています。DrugAgent のアーキテクチャとデプロイ上の限界は論文 v2に基づいています。SciAgents のライセンスの食い違いは、ライセンスファイルとパッケージメタデータで確認できます。