概览
Datamol Skill (K-Dense) 是 Scientific Agent Skills 集合中的一项流程指南。它提供有关使用 Datamol 的说明和示例工作流参考;Datamol 是 RDKit 的 Python 抽象层,可用于化学信息学和药物发现任务。该 Skill 既不是 Datamol 软件包,也不是可独立运行的智能体:它的作用是指导助手或研究人员使用另行安装的软件执行分子操作。
文档所述的工作流从分子字符串或结构文件开始,依次进行解析、针对具体任务的标准化、描述符或指纹计算,以及后续分析。输入包括 SMILES 和 SDF、CSV 等文件格式;文档所述的输出包括原生的 rdkit.Chem.Mol 对象、分子表示、描述符表、相似性距离、聚类、骨架、构象和可视化结果。该 Skill 提供了各项操作的示例参考,以及更全面的加载/筛选/分析、骨架系列构效关系(SAR)和虚拟筛选工作流参考。它还说明指纹可用于独立的机器学习工作流,而该 Skill 本身并不提供预测模型。
其实用指导强调保留原始结构和标识符、记录被拒绝的输入,并选择适合科学任务的转换方式。标准化并不被描述为能够保证修复化学结构。环境变化可能影响规范表示和保留的构象,而完整的两两聚类可能超出可用内存。远程文件工作流需要特定提供方的凭证;源材料明确说明其报告的测试不包括远程授权和写入。这些界限表明,该 Skill 适合作为工作流指南,而不能作为某个数据集或科学结果已经过验证的证据。
主要功能
- 提供分子解析、格式转换、清理和针对具体任务的标准化说明,包括保留处理失败的源记录。
- 提供描述符、指纹、相似性距离、近邻查询、聚类和多样性选择等工作流的示例参考。
- 提供骨架和片段分析指导,包括 Bemis-Murcko 分组和按骨架划分的训练/测试集。
- 提供构象生成、RMSD 聚类、代表构象选择、SASA 计算和分子可视化指导。
- 提供文件和批处理说明,涵盖分子文件、表格输出、并行操作以及依赖凭证的远程 I/O。
- 提供化合物库制备与分析、骨架系列构效关系(SAR)和虚拟筛选的端到端工作流参考。
使用场景
- 建议评估:制备外部化合物库,同时保留原始结构、标识符、转换记录和被拒绝的输入。
- 建议评估:使用指纹、相似性分组和有边界的多样性选择来探索化合物集合,再选择筛选子集。
- 建议评估:按骨架整理构效关系(SAR)系列,并生成对齐的分子视图以供检查。
- 建议评估:为下游模型构建按骨架划分的分子特征,并检查各数据划分中的预处理和指纹设置是否一致。
使用方式
- 阅读指定的 Skill 文件,以确定相关工作流及其环境要求。将其视为说明文档,而非可运行的智能体。
- 按照 Skill 的设置部分准备隔离的 Datamol 环境。有关上游 API 的详情,请查阅链接中的 Datamol 文档;请区分 Skill 与软件包各自的作用。
- 提供带有稳定源标识符的分子字符串或结构文件。在处理之前确定针对具体任务的标准化策略,并保留原始数据和解析失败记录。
- 根据 Skill 中引用的工作流部分,开展描述符、相似性、骨架、构象或文件处理。先用小型评估子集开始,并在扩大分析规模前检查输出。
- 记录环境和转换选项。检查化学不变量,不要期望不同环境产生完全相同的规范字符串或构象数量;为聚类预留足够内存,并仅在需要远程 I/O 时提供凭证。