概览
Therapeutics Data Commons (TDC) 组织用于治疗发现与开发领域机器学习的数据集和评估工作流程。其文档所述范围包括靶点发现、活性筛选、疗效、安全性和制造,涉及小分子、抗体和疫苗等生物医学产品。该资源将数据集访问与模型开发和比较所需的辅助工具结合起来;它并不是单一的预测模型。
TDC 按问题、学习任务和数据集组织资源。问题类别区分针对单个生物医学实体的预测、涉及多个实体的预测,以及新实体生成。研究人员通过 Python API 选择任务和数据集,以受支持的格式获取数据,并取得训练、验证和测试分区。README 展示了如何加载 ADME 数据集 HIA_Hou、返回 dataframe 并构建 scaffold split。评估工具接收参考标签和模型预测,以计算所选指标;分子生成 oracle 则为给定分子返回分数。
在研究工作流程中,TDC 可为单独开发的模型提供数据准备和评估层。数据处理函数涵盖标签转换、平衡处理、负采样和图数据准备;主题基准组则支持对相关数据集进行比较,包括 ADMET 任务。README 还链接到有关单细胞资源、PrimeKG、外部 API 和模型中心的教程。
项目 README 将该软件包描述为 beta 版。数据集检索还取决于托管服务是否可用:许多数据集存放在 Harvard Dataverse,其维护可能导致访问中断。代码采用 MIT 许可证并不能确定数据集的使用权;必须逐一核查。文档中介绍的基准测试功能不应被视为某个特定模型适用于临床用途的证据。
主要功能
- 分层 Python 数据加载器按预测或生成问题、治疗学习任务和数据集组织访问。
- 数据集划分支持可配置的划分方法、随机种子和比例,其中包括文档所示的 scaffold-split 示例。
- 评估工具根据参考标签和模型预测计算任务指标,例如 ROC-AUC。
- 数据处理函数包括标签转换、平衡处理、负采样以及 PyG/DGL 图数据准备。
- 分子生成 oracle 支持目标导向和分布学习工作流程,其中包括文档所示的 GSK3B oracle。
- 主题基准组提供数据集访问、跨多次运行的预测评估,以及排行榜提交工作流程。
使用场景
- 建议的评估:使用 scaffold split 在 ADME 数据集上比较分子性质模型,以考察模型对未见化合物的泛化能力。
- 建议的评估:使用文档所述的划分和评估工作流程,在 ADMET_Group 基准上评估模型。
- 建议的评估:在生成实验中使用 TDC 分子生成 oracle 为候选分子评分,但不要将 oracle 分数视为实验验证。
- 建议的评估:使用文档所述的 PyG/DGL 处理函数,为图学习实验准备治疗领域数据集。
使用方式
从任务和数据集概览入手,选择治疗相关问题,并查看相关数据集的说明、原始出版物和数据集特定许可证。
按照代码仓库 README中的安装说明操作。README 将该软件包标识为 PyTDC,并说明其发布状态为 beta;API 使用指南请参阅文档。
使用文档所示的加载器模式获取所选数据集。建模前先检查返回的数据;README 展示的是以 dataframe 形式获取 HIA_Hou,而不是提供训练好的预测器。
根据数据划分指南选择合适的数据分区。记录划分方法、种子和比例,以便比较时使用相同的评估设置。
如果检索失败,请检查 Harvard Dataverse 的可用情况;README 指出,该平台维护可能造成访问中断。