概览
MolScribe 使用图像到图模型,从分子图像中识别化学结构。它用于化学文档处理工作流中的结构识别阶段:输入分子示意图,预测接口则返回结构化的化学表示。该仓库提供 Python 软件包、可下载的模型检查点、预测示例,以及训练和评估资源。关联的 HuggingFace 演示也提供了另一种体验模型的方式。
文档所述的预测 API 会返回一个字典,其中包含 SMILES 和 molfile 表示。可选输出包括总体置信度、原子符号及坐标、键类型及端点索引,以及原子级和键级置信度。快速入门示例会加载检查点,并在 CPU 上对图像文件进行预测。该架构使用 Swin-B 图像编码器和六层 Transformer 解码器,文档注明的输入尺寸为 384×384。
对于研究工作流,README 链接了基于 USPTO 和 PubChem 衍生的训练数据集,以及合成、真实和扰动图像基准。README 还介绍了训练脚本,以及一个独立评估器,该评估器会将预测 CSV 文件与参考结构进行比较。评估分别考察 canonical SMILES 精确匹配、忽略四面体手性的图精确匹配,以及手性分子的精确匹配。
这些资源有助于评估模型在所选图像集合上的识别表现,但来源摘录并未确定其在特定部署环境或文档类型上的准确性。MolScribe 被定位为分子图像识别工具;反应图解析和更广泛的文献提取则作为独立项目提供链接。仓库的 MIT 代码许可证不应被视为检查点或数据集许可条款的依据。
主要功能
- 从分子图像文件预测化学结构的图像到图功能,输出 SMILES 和 molfile。
- 可选的原子和键记录,包括原子坐标、键类型及端点原子索引。
- 可选择报告整体预测以及单个原子和键的置信度。
- 通过 Python 接口、脚本和 Jupyter notebook 提供可下载的检查点和预测示例。
- 训练和评估资源涵盖 USPTO 与 PubChem 训练数据,以及合成、真实和扰动基准。
- 基于 CSV 的独立评估,可报告 canonical SMILES、图和手性精确匹配分数。
使用场景
- 预期评估:将文献处理流水线中的分子示意图转换为候选 SMILES 和 molfile,以供后续检查。
- 预期评估:利用原子坐标和键连接关系,对照源示意图检查识别错误。
- 预期评估:使用文档所述的评估器,在合成、真实或扰动图像集合上将预测结果与参考结构进行比较。
- 预期评估:使用关联的数据集和检查点,复现或扩展文档所述的训练工作流。
使用方式
- 阅读官方 README,在快速预测工作流与独立的训练或评估设置之间作出选择。关联的演示是另一种入门方式。
- 按照文档中的软件包安装流程操作。对照setup.py中声明的 Python 要求和依赖项,检查它们是否适用于你的目标环境;这些声明并不能证明兼容性经过测试。
- 从HuggingFace Hub获取检查点。使用与你选择的 README 示例相对应的检查点,不要假设快速入门示例和实验示例所用的检查点相同。
- 按照 README 中的图像文件预测示例操作。如有需要,请请求返回原子/键记录和置信度信息,然后对照输入图像检查返回的 SMILES、molfile 和图详情。
- 对于预期评估,请准备
image_id值相匹配的预测和参考 CSV 文件。按照 README 中的独立评估说明操作,按文档所述选择预测列,并分别解读这三项精确匹配指标。