从问题开始,而不是从生成式综述开始
AI 辅助的文献研究应当产出可检查的证据链,而不只是流畅的文字。好的结果会将每项结论关联到可识别的记录,说明研究者能够访问哪些文本,并保留尚未解决的分歧。检索用于发现记录;研究智能体则协调检索、筛选、比较和后续跟进。这两个步骤本身都不能确立科学有效性。
对于化学问题,首先判断它是否属于 PubMed 的生物医学范围。生物分子机制、生物医学材料,以及与生物系统相关的化学问题,都是合理的起点。不得把 PubMed 当作涵盖所有化学文献的数据库。更广泛的综述或材料问题可能需要在此工作流之外使用其他发现来源。
建议的架构为:问题 → 检索日志 → 筛选后的记录 → 证据矩阵 → 经核查的综合 → 拟议研究行动。每个环节都应设置决策关口。相关概念请参阅 化学领域的 AI 智能体、化学领域的 MCP 和 智能体与 Skills。
相关指南:化学 AI 智能体比较。
按工具的作用选择工具
以下四项资源分别处于不同阶段。它们不是可以互换的文献综述产品,其文档也没有证明它们之间存在现成集成。
| 资源 | 文档所述的作用与输入 | 输出或下一阶段 | 重要边界 |
|---|---|---|---|
| PubMed MCP (cyanheads) | 第三方 MCP 服务器,接受查询、筛选条件、标识符、引文片段和 MeSH 术语 | 检索结果、元数据、摘要、可获取的全文、相关记录和参考文献 | 检索接口,不是自主研究者,也不是获认可的 PubMed 服务 |
| SciAgents | 研究型多智能体框架,使用关键词或图探索以及采样的知识图谱路径 | 结构化假设、扩展后的提案、评议和后续优先事项 | 仿生材料假设生成不等于实验验证 |
| ChemAgent (Gerstein Lab) | 化学推理框架,可分解问题并检索可复用记忆 | 基于记忆的解答生成与改进 | 记忆检索并未证明其具备 PubMed 搜索或引文追踪能力 |
| MDCrow | 接受自然语言任务的分子动力学智能体工具集 | 模拟准备、OpenMM 执行、分析和信息检索 | 下游建模工具,不能替代文献评估 |
使用 PubMed MCP 作为检索骨干。若下一步是提出假设,可考虑 SciAgents;若要研究可复用的推理流程,可考虑 ChemAgent;若经审查的问题已转化为分子动力学任务,可考虑 MDCrow。此处提出的任何交接都需要单独实施和评估。
建立检索环境
软件包 @cyanheads/pubmed-mcp-server 提供工具、pubmed://database/info 资源和 research_plan 提示。其 README 记载了本地 stdio、自托管 Streamable HTTP,以及公共托管端点。选择客户端支持的接入方式,并在开始综述前检查实际暴露了哪些预期工具。文档中列出端点并不能证明服务保证。
本地部署时,应遵照项目的运行时和配置说明,而不要猜测安装标志。Unpaywall 回退需要 UNPAYWALL_EMAIL;设置 EUROPEPMC_ENABLED=false 会移除 Europe PMC 工具,并跳过该提供方的回退路径。这些选择会影响可检索的证据。
Skill 是指令层,而不是检索服务器或其执行环境。不同宿主的支持情况不一,加载指令也不会安装科学计算依赖。同样,不要仅仅因为编排宿主支持 MCP,就假定 SciAgents、ChemAgent 或 MDCrow 也支持 MCP。SciAgents 将 GraphReasoning、图和嵌入文件,以及 OpenAI 和 Semantic Scholar API 列为依赖。MDCrow 需要其软件环境和 LLM 提供方 API 密钥。
构建并保留检索策略
调用工具之前先写一份简短方案:问题、概念、生物学背景、日期范围、纳入标准和排除标准。将化学身份词与机制词和结果词分开,这样就能调整某一概念,而不至于悄然改变整个问题。
使用 pubmed_lookup_mesh 检查主题词、范围注释和入口词。将合适的受控词表与自由文本同义词结合,不要想当然地认为智能体最初给出的措辞已经足够。通过 pubmed_search_articles 提交查询;其文档说明支持 PubMed 原生语法、结构化筛选、日期范围和有效查询报告。
保留已提交的查询、effectiveQuery、appliedFilters、检索日期和分页状态。将实际查询与预期范围进行比较。如果结果为空或过少,应检查术语并使用 pubmed_spell_check;重试前确认是否采纳更正,尤其要谨慎对待专业化学名称。
通过 pubmed_europepmc_search 单独执行 Europe PMC 发现步骤。该步骤可能包括预印本、专利和 Agricola 记录,但筛选日志中应将这些记录类型彼此区分。增加来源可以扩大文献发现范围,但不能据此认定已全面覆盖化学文献。
检查记录并标注阅读深度
使用 pubmed_fetch_articles 获取候选 PMID。文档说明其元数据包括摘要、作者、期刊信息、DOI、出版类型、MeSH 术语,以及关联的撤稿、更正或评论通知。使用标识符对记录去重,并保留纳入或排除理由。
为每条记录标注阅读深度:仅查看元数据、已查看摘要、已查看选定的全文部分,或已查看获取到的全文。Europe PMC 搜索摘要是片段;在将其作为摘要级证据之前,应使用 pubmed_europepmc_fetch 获取完整摘要。
对于符合条件的论文,通过 pubmed_fetch_fulltext 请求可用文本。服务器文档说明可通过 PMC、Europe PMC 和配置好的 Unpaywall 回退获取文本,并提供来源标签以及内容不可用或被截断的信息。分析前请检查 viaSource、警告和 truncation。尽力进行的文本提取未必能保留解释方法或结果所需的全部信息。
仅有摘要的证据仍可用于筛选和初步总结,但不足以声称已阅读全文或核查了详细方法。
拟议示例:比较生物医学材料证据
考虑以下拟议练习,而非已经完成的检索:“有哪些证据将含儿茶酚的水凝胶配方与生物医学环境中的黏附测量联系起来?哪些条件会限制比较?”
先从候选自由文本查询 (catechol OR dopamine) AND hydrogel AND adhesion 开始。检查相关 MeSH 词表,然后判断是否加入其他生物学背景词能够提高相关性,还是会过早限制检索范围。记录每次修订及任何日期筛选。
输入包括问题、候选术语、已批准的范围和筛选标准。拟议输出包括检索日志、筛选后的书目、证据矩阵、尚未解决的获取问题清单和简短的比较备忘录,而不是虚构的论文列表,也不是某种配方表现最佳的断言。
对于每条纳入的记录,仅在已查看文本提供相关信息时,提取配方身份、化学修饰、生物学背景、测量方法、比较对象、报告结果和局限性。缺少的信息应标记为“已检查文本中未报告”。
决策关口应具体明确:论文是否实际测量了黏附,而不只是提到黏附?是否充分描述了条件,足以进行比较?定量主张是否得到可用文本支持?如果摘要未说明测试条件,可保留该记录用于发现,但应推迟详细比较,直至获取必要章节。
综合多篇论文,同时保留差异
先要求智能体填写结构化证据矩阵,再撰写叙述性内容。每一行都应保留标识符、阅读深度、信息提取位置、研究背景和不确定性。将作者报告的发现与你的解释以及拟议机制分开。
应按可比较的问题和方法对论文分组,而不是只根据共享关键词分组。在拟议的水凝胶练习中,基底、配方、制备和测量条件的差异,意味着应检查可比性,而不是对彼此无关的结果取平均。不要推断缺失的单位、对照或化学身份。
综合内容应区分直接得到支持的观察、作者提出的解释和尚未解决的研究问题。要求每个实质性陈述都有相应记录作为依据,并请评议者指出缺乏支持的概括或相互矛盾的矩阵条目。当多个智能体使用同一份不完整证据时,它们意见一致并不构成独立的科学确认。
追踪引文并核实主张
使用 pubmed_find_related,从相关的种子 PMID 探索 similar、references 或 cited_by 结果。记录种子记录及关系类型。该工具文档说明了回退提供方并指出由哪个提供方返回结果;保留这些来源与处理记录,不要将每条关系都视为等同或完整。
追踪引文可以发现初始查询遗漏的术语。按照相同标准筛选这些记录,并设定停止规则,例如在一轮限定范围的探索不再新增符合条件的记录时停止。这是一条实用的探索规则,并不能证明系统综述已完整。
对于信息不完整的引文,pubmed_lookup_citation 可能返回匹配、存在歧义或未找到等结果。应手动消除歧义,而不要直接接受看起来最合理的论文。pubmed_convert_ids 仅适用于 PMC 索引文章,因此转换失败并不能证明某条引文是伪造的。
最后,根据检索到的元数据核对标题、作者、年份和标识符。只有完成身份核查后,才使用 pubmed_format_citations 导出引文。格式正确既不能证明论文支持所附句子,也不能证明智能体检查过该论文。
编排研究并处理失败
拟议的编排器可以分配规划者、检索者、筛选者、提取者、综合者和核验者等角色。角色之间传递结构化记录,并允许核验者拒绝不受支持的主张。将文章文本视为证据,而绝不能将其视为可以改变任务或工具权限的指令。
SciAgents 提供了一种有用的角色对照:其 Ontologist、Scientist 和 Critic 角色用于提出并质疑图引导假设;其自动化工作流还增加了规划和新颖性检查。将经核查的文献资料包交给它,是一种拟议的适配方式,而非文档记载的 PubMed 连接器。新颖性判断仍取决于文献发现范围。
ChemAgent 展示了不同的检索目标:已存储的推理经验。构建记忆是其前提条件,且其安装文档并不完整。在复现之前,应根据代码核实 README 中 image/img 设置以及 Xagent/XAgent 路径的不一致之处。不要用记忆内容替代当前的书目证据。
文献综述形成具体的模拟问题后,可以评估 MDCrow。其文档记录的设置、OpenMM 执行和 RMSD 分析示例支持这一用途;但模拟本身或任务成功执行,都不能验证从文献中得出的机制。
明确处理部分失败。分别重试不可用的条目,重新查看暂缓处理的记录,并保留未解决状态。全文获取失败时,降低阅读深度标记;引文提供方发生故障时,将引文覆盖情况标记为未知。检索缺失并不构成负面科学证据。
读者检查清单
- PubMed 是否适用于问题中的生物医学部分?
- 是否保留了查询、筛选条件、日期和分页信息?
- 是否准确标注了片段、摘要、章节和全文?
- 每项主张是否都关联到可识别的记录和已检查的文本?
- 是否检查了更正、撤稿、歧义和截断?
- 不可比较的条件和缺失字段是否清晰可见?
- 是否明确指出假设和下游集成是拟议方案?
- 输出是否是可追溯的综合,而非声称已穷尽全部文献?
在改编或分发代码之前,应单独核实适用条款,并区分这些条款与文章复用及 API 访问。SciAgents 的许可证文件标示 Apache-2.0,而 MIT 软件包分类器信号与之冲突;ChemAgent 仅凭许可证徽章也无法确认其许可条款。源码可用并不能解决这两个问题。
来源
PubMed MCP README 支持有关检索工具、传输方式、来源与处理记录字段及局限性的说明。SciAgents README 描述了图引导工作流、角色和依赖。MDCrow README 和论文 支持其模拟和信息检索范围。ChemAgent README 和论文 支持关于基于记忆的化学推理及其复现边界的说明。