跳转到正文

Therapeutics Data Commons

PyTDC Team

Therapeutics Data Commons 提供治疗领域的机器学习数据集、Python 加载器、数据划分、评估指标和基准测试,供预测与分子生成研究使用。

条目更新 ·

概览

Therapeutics Data Commons (TDC) 组织用于治疗发现与开发领域机器学习的数据集和评估工作流程。其文档所述范围包括靶点发现、活性筛选、疗效、安全性和制造,涉及小分子、抗体和疫苗等生物医学产品。该资源将数据集访问与模型开发和比较所需的辅助工具结合起来;它并不是单一的预测模型。

TDC 按问题、学习任务和数据集组织资源。问题类别区分针对单个生物医学实体的预测、涉及多个实体的预测,以及新实体生成。研究人员通过 Python API 选择任务和数据集,以受支持的格式获取数据,并取得训练、验证和测试分区。README 展示了如何加载 ADME 数据集 HIA_Hou、返回 dataframe 并构建 scaffold split。评估工具接收参考标签和模型预测,以计算所选指标;分子生成 oracle 则为给定分子返回分数。

在研究工作流程中,TDC 可为单独开发的模型提供数据准备和评估层。数据处理函数涵盖标签转换、平衡处理、负采样和图数据准备;主题基准组则支持对相关数据集进行比较,包括 ADMET 任务。README 还链接到有关单细胞资源、PrimeKG、外部 API 和模型中心的教程。

项目 README 将该软件包描述为 beta 版。数据集检索还取决于托管服务是否可用:许多数据集存放在 Harvard Dataverse,其维护可能导致访问中断。代码采用 MIT 许可证并不能确定数据集的使用权;必须逐一核查。文档中介绍的基准测试功能不应被视为某个特定模型适用于临床用途的证据。

主要功能

  • 分层 Python 数据加载器按预测或生成问题、治疗学习任务和数据集组织访问。
  • 数据集划分支持可配置的划分方法、随机种子和比例,其中包括文档所示的 scaffold-split 示例。
  • 评估工具根据参考标签和模型预测计算任务指标,例如 ROC-AUC。
  • 数据处理函数包括标签转换、平衡处理、负采样以及 PyG/DGL 图数据准备。
  • 分子生成 oracle 支持目标导向和分布学习工作流程,其中包括文档所示的 GSK3B oracle。
  • 主题基准组提供数据集访问、跨多次运行的预测评估,以及排行榜提交工作流程。

使用场景

  • 建议的评估:使用 scaffold split 在 ADME 数据集上比较分子性质模型,以考察模型对未见化合物的泛化能力。
  • 建议的评估:使用文档所述的划分和评估工作流程,在 ADMET_Group 基准上评估模型。
  • 建议的评估:在生成实验中使用 TDC 分子生成 oracle 为候选分子评分,但不要将 oracle 分数视为实验验证。
  • 建议的评估:使用文档所述的 PyG/DGL 处理函数,为图学习实验准备治疗领域数据集。

使用方式

  1. 从任务和数据集概览入手,选择治疗相关问题,并查看相关数据集的说明、原始出版物和数据集特定许可证。

  2. 按照代码仓库 README中的安装说明操作。README 将该软件包标识为 PyTDC,并说明其发布状态为 beta;API 使用指南请参阅文档。

  3. 使用文档所示的加载器模式获取所选数据集。建模前先检查返回的数据;README 展示的是以 dataframe 形式获取 HIA_Hou,而不是提供训练好的预测器。

  4. 根据数据划分指南选择合适的数据分区。记录划分方法、种子和比例,以便比较时使用相同的评估设置。

  5. 训练自己的模型,并按照评估指南计算相关指标。进行分组比较或提交时,请遵循基准测试概览。

  6. 如果检索失败,请检查 Harvard Dataverse 的可用情况;README 指出,该平台维护可能造成访问中断。

相关资源

DrugAgent 是一个研究型多智能体框架,它结合 LLM 规划与领域指导的代码生成,用于构建和评估药物发现领域的机器学习工作流。

分子性质预测 · 药物发现

TorchDrug

开源工具

TorchDrug 是一个基于 PyTorch 的图与分子机器学习工具包,支持 SMILES 输入、图操作、性质预测构建模块以及多 CPU/GPU 执行。

开源Python

分子性质预测 · 药物发现

AIDDISON Explorer 是一个托管式药物发现平台,可根据目标特性要求、设计约束、预测属性和合成可行性生成并排序分子候选物。

分子生成 · 药物发现

AutoDock Vina

开源工具

AutoDock Vina 是一款开源分子对接与虚拟筛选程序,提供 Vina 和 AutoDock4.2 评分、多配体对接、大环分子支持及 Python 3 绑定。

开源Python

药物发现

Boltz

模型

Boltz 是生物分子相互作用预测模型家族;Boltz-2 提供复合物结构与结合亲和力预测流程。

开源Python

药物发现

ChemBERTa

模型

ChemBERTa 提供用于化学 SMILES 的类 BERT 模型,包括采用 RoBERTa 掩码语言建模的检查点,以及用于预训练、微调和分子性质预测研究的笔记本。

开源Python

分子性质预测

相关指南

概览

如何搭建一个化学 AI Agent 技术栈

通过区分语言模型、编排、Skills、MCP 接口、API、库和数据,设计化学 AI 智能体技术栈。参考提出的分子与材料工作流,定义输入/输出契约,并规划权限、评估和可复现部署。

数据集

化学 AI 数据集的来源与许可

在合并数据或设计模型评估之前,建立可审计的记录,追踪化学数据集的来源、使用条件、标识符和转换过程。

许可

分别审阅代码、模型权重与数据许可

为化学 AI 工作流建立逐组件许可记录,将软件、模型权重、数据集和托管服务分别处理,并明确标示缺失证据与未解决的条件。