概览
ChemDataExtractor v2 是一个用于从科学文献中提取化学信息的工具包。它支持一套文献处理流程:读取文档,使用具备化学领域感知能力的自然语言处理技术分析文本,并提取化学信息供后续使用。它是一个信息提取工具包,而非文献数据库或化学性质预测模型。
文档中列出的输入格式为 HTML、XML 和 PDF。其提取组件包括化学命名实体识别、用于性质和光谱的基于规则的语法,以及表格数据解析器。这些功能既面向叙述性文本,也面向表格,使用户能够评估从论文中提取信息的不同途径。文档级处理也被描述为能够解决提取数据之间的相互依赖关系,但项目 README 未说明具体的处理规则,也未提供示例。
预期输出为提取出的化学信息,包括实体、性质与光谱数据,以及表格内容。来源摘录未说明输出架构、导出格式、支持的性质类别或提取准确率。因此,应使用有代表性的文档并对结果进行人工核查,来评估它是否适用于特定的文献集合,而不应仅凭功能列表作出判断。
README 提供了通过 pip 安装的方式,并说明支持 Python 3.9 至 Python 3.11。它还链接到开发和贡献指南文档。包元数据声明了一个名为 cde 的命令行入口点,但摘录未说明其调用选项。setup.py 中的 Python 版本分类器与 README 的支持说明存在差异,因此不应将其视为已测试兼容性的证据。
主要功能
- 用于读取 HTML、XML 和 PDF 格式科学文献的文档阅读器。
- 用于处理文档文本、具备化学领域感知能力的自然语言处理流程。
- 化学命名实体识别。
- 用于提取性质和光谱的基于规则的解析语法。
- 用于恢复表格数据的表格解析。
- 通过文档级处理解决提取数据之间的相互依赖关系。
使用场景
- 建议的评估步骤:从有代表性的一组论文中提取化学实体,并将结果与人工标注的文本进行比较。
- 建议的评估步骤:使用文档所述的基于规则的解析功能,从文献段落中提取性质或光谱信息。
- 建议的评估步骤:从科学表格中提取数据,并检查数值及其上下文关联是否得到保留。
- 建议的评估步骤:比较有代表性文档的 HTML、XML 和 PDF 版本中的提取结果,再选择摄取流程。
使用方式
- 阅读官方 README,在选择环境前确认其中说明的输入格式、提取组件和 Python 支持范围。
- 按照 README 中的安装指南创建并激活隔离环境。README 以使用 Python 3.11 的 conda 环境为例;其中说明支持 Python 3.9–3.11,但此处未进行独立验证。
- 使用所提供的指令安装软件包:
pip install chemdataextractor2。注意区分包名与项目显示名称 ChemDataExtractor。 - 查阅链接的文档了解工作流程详情。确定如何连接相关的文档阅读器、文本或表格提取组件以及输出处理;来源摘录未包含这些细节。
- 作为评估步骤,处理一小组有代表性的文档,并对照原文人工检查化学实体、性质、光谱和表格数据。在考虑扩大文献处理流程之前,记录遗漏或错误的提取结果。