从来源记录开始
在合并化学数据集之前,先明确每项输入代表什么以及来自何处。仅记录下载位置并不足够:镜像、处理后的归档文件和原始发布版本可能包含相互关联但并不相同的记录。
为每个输入数据制品创建一条清单记录。记录发布方、数据集名称、发布标识符、来源 URL、访问日期、文件名和校验和。若能获取,注明发布日期;缺失信息应标记为未知,而不是推断。注明该制品是原始发布版本还是衍生版本,并将相关引文与数据一并保留。
**输入:**下载的文件、来源文档和可用的发布元数据。**输出:**一份清单,将每个制品关联到其来源及任何已知的上游发布版本。
决策问题:其他人能否获取同一制品?每条经过处理的记录能否追溯到原始记录?如果没有发布标识符,有什么证据可以区分此次下载与较晚版本?
将数据权利与代码许可分开
分别检查数据集许可和访问条款,以及代码仓库许可。记录相关条款文本或其位置、适用的材料,以及有关再分发、商业用途和衍生作品的未决问题。不要假定公开可下载的数据就允许所有预期用途。
所提供的资源参考说明了这一区分的重要性:
- Therapeutics Data Commons 描述了 MIT 代码许可,而数据集的使用权需要逐项核查。
- Open Reaction Database 区分了数据集许可与代码仓库代码许可。
- SPICE 将数据集使用描述为 CC0,并与其代码仓库的 MIT 许可分别说明。针对所选发布版本记录这一来源声明,不要将其扩展到无关的输入数据。
对于计划开展的每项操作,都应询问:我们是否获准下载、转换、用于训练并再分发这些材料?如果证据无法回答某个问题,应记录这种不确定性并寻求澄清。来源核查清单并非法律认定。
验证标识符、单位和科学含义
在创建规范化字段之前,保留来源标识符和原始值。维护原始记录与处理后记录之间的映射,包括转换失败和匹配不明确的记录。
检查单位、缺失值约定、实验条件和计算方法。属性名称相同并不能证明标签可以互换。同样,分子连接关系匹配也不能证明两种构象或测量结果是重复项。
特定资源的细节可能影响映射。Open Reaction Database 将序列化反应记录存储在 Parquet 文件中,其链接的参考资料指出,reaction_id 列是权威标识。资料还介绍了用于映射合并后数据集 ID 的 retired_datasets.csv。处理旧版引用时,应保留这些关系。
对于计算标签,应保留程序、理论方法和可用设置。SPICE 特别提醒:生成兼容的参考计算时,仅匹配理论水平并不足够,程序和设置也必须匹配。
**输出:**一份模式字典、标识符对照表和验证报告,其中列出尚未解决的记录,而不是将其静默覆盖。
检查表示形式、覆盖范围和重复项
在统计记录之前,先选择分析单位:分子、构象、反应、测量结果或分子簇。随后检查与预期任务相关的覆盖情况,例如元素、电荷状态、分子类别、目标范围和测量方案。若人口群体覆盖情况与数据及任务相关,也应予以考虑。
GEOM 提供带有能量和统计权重注释的分子构象。其链接的参考资料指出,MessagePack 归档文件不会随 Python 专用数据中的新增内容而更新。应记录所用的表示形式;仅凭资源名称不能认定其覆盖范围完全相同。
检查完全重复项、规范化结构匹配项和相关观测。即使行标识符不同,同一分子的多个构象或来自共同来源的测量结果,也可能导致信息泄漏到不同数据分区。根据科学问题选择适当的分组规则,并保留有歧义的案例以供检查。
对于 Matbench,链接的参考资料确认其包含 13 项材料科学任务,但未说明各任务的输入模式或数据拆分细节。在认定某项任务与另一数据集兼容之前,请查阅链接中的文档。
为每项转换标注版本
将解析代码、配置、校验和及上游发布标识符与每个处理后版本一并保存。记录筛选规则、单位转换、标识符规范化、标签转换和数据分区分配。单独保留原始输入,避免修订规则时抹去原始证据。
记录每个阶段的输入和输出记录数,以及排除记录的原因。计数有助于定位处理错误,但不能证明科学正确性。通过与来源标识符关联的简短决策日志,使人工决策可复现。
Therapeutics Data Commons 介绍了加载器、处理函数和可配置的数据拆分,包括一个 scaffold 拆分示例。这些功能可以支持数据准备,但用户仍需记录所选数据集、参数和返回的分区。文档中提及某项功能,并不意味着某个具体工作流程已成功测试。
规划示例:比较构象来源
**假设情景:**某团队希望探索 GEOM 和 SPICE 是否可用于分子能量学习研究。这是一项拟议的评估计划,并非经过测试的集成方案。
- 从每项资源中选取一个具体制品,并记录其发布版本、表示形式、校验和及使用条件证据。
- 检查少量样本,识别分子键、构象坐标、能量字段、单位和计算来源信息。
- 建立对照表,将分子身份与构象身份分开。标记可能重叠的分子,但不要假定其几何结构相同。
- 在评估其定义、参考约定和计算设置之前,将两个来源的标签分开处理。
- 提议按分子分组进行数据拆分,并在训练前量化重叠情况。如果相关记录跨越不同分区,应重新考虑拆分方案。
规划产出应为兼容性表和是否继续的决策,而不是合并后的训练集。如果标签可比性仍未解决,应分别评估各来源,或缩小问题范围。不要仅仅因为两个资源都提供能量数据,就将能量值合并。
说明局限和未决事项
发布数据声明,说明数据来源、使用条件证据、转换过程、排除项、拆分逻辑和已知覆盖缺口。提供引文和反馈更正的途径。区分来源文档所描述的功能、建议执行的检查,以及团队实际完成的检查。
来源追踪不能证明标签准确、模型性能良好,也不能证明数据适用于临床或其他具有重大影响的用途。即使处理流程可复现,观测稀疏、方案不一致和权利不明确仍然是局限。
可执行清单与后续步骤
- 记录每个制品的来源、发布版本和校验和。
- 将数据集条款与代码许可分开处理。
- 保留原始标识符、数值和计算背景。
- 在拆分前审查不明确的匹配项和相关记录。
- 为转换标注版本,并记录未决事项。