概览
ChemBERTa 是一组应用于化学 SMILES 字符串的类 BERT 模型。该仓库将这些模型定位于化学建模、药物设计研究和分子性质预测。其文档所述工作流程以预训练和微调笔记本为核心,而非独立的化学应用程序。README 指出,笔记本使用的架构是 RoBERTa(一种 BERT 变体),训练任务则是掩码语言建模。
模型输入为 SMILES 文本。所提供的示例从检查点 seyonec/ChemBERTa-zinc-base-v1 加载匹配的分词器和模型,然后构建 Hugging Face fill-mask 管道,以预测掩码词元。README 还链接了与 ZINC 100k、ZINC 250k、PubChem 100k、PubChem 250k、PubChem 1M 和 PubChem 10M 相关的预训练权重。这些检查点可作为研究化学语言建模和下游适配的起点;仓库的笔记本工作流程包含评估和微调。
对于分子性质预测工作,链接的 DeepChem 迁移学习教程是一个实用的入门资源,而 ChemBERTa 和 ChemBERTa-2 论文可作为研究参考。应区分掩码词元预测与特定任务的分子性质输出;后者需要适当的下游工作流程。README 将笔记本说明与路线图及清单声明混在一起,其中包括标记为正在进行的工作。这些声明并不能证明所有拟议的实现或可视化组件都已可用,来源摘录也未说明当前依赖项兼容性或预测性能。
主要功能
- 基于 RoBERTa 的化学语言建模,使用 SMILES 字符串和掩码语言建模训练目标。
- README 链接了六个 ZINC 和 PubChem 数据集子集的预训练权重,规模从 100k 到 10M 不等。
- 介绍 ChemBERTa 模型预训练、微调和评估工作流程的笔记本。
- 使用 `seyonec/ChemBERTa-zinc-base-v1` 加载分词器和模型,并搭配 Hugging Face `fill-mask` 管道的示例。
- 链接的 DeepChem 教程,重点介绍使用 ChemBERTa transformers 进行迁移学习。
使用场景
- 建议的评估:使用文档所述的分词器与检查点组合,在有代表性的 SMILES 输入上研究掩码词元预测。
- 建议的评估:通过链接的迁移学习工作流程,评估 ChemBERTa 在分子性质数据集上的微调效果。
- 建议的评估:在一致的下游评估方案下比较所列的 ZINC 和 PubChem 预训练检查点。
使用方式
- 阅读仓库 README,区分文档所述的笔记本工作流程与路线图事项。确定目标是掩码语言建模还是下游性质预测。
- 参考 DeepChem 迁移学习教程了解链接的学习工作流程。准备环境前,请核查其实际要求;来源摘录未说明安装步骤。
- 浏览链接的 Hugging Face 模型,并选择与评估相关的检查点。请将检查点专属文档和条款与仓库代码许可证分开核查。
- 对于掩码词元任务,请遵循 README 中针对
seyonec/ChemBERTa-zinc-base-v1的模型与分词器搭配方式及其fill-mask管道示例。应在有代表性的 SMILES 上评估其行为,而不要假定它会输出性质预测结果。 - 对于下游实验,请参考该教程开展微调和评估。参阅 ChemBERTa-2 论文,了解 README 所要求的研究参考资料。