看分数前先定义预测任务
Boltz-2 的结构预测与亲和力预测回答不同问题。文档中的 YAML 接受蛋白、DNA、RNA 和配体实体,配体由 SMILES 或 CCD 描述;亲和力需另行请求。结构合理的复合物不能提供实验结合测量。本文用于解读结果,操作配置请参阅关联 Recipe。
置信度不是亲和力
| 输出 | 文档中的含义 | 不应推断 |
|---|---|---|
| pLDDT / complex_plddt | 局部或汇总结构置信度 | 实验功能 |
| pTM / ipTM 及链、界面变体 | 整体或界面结构置信度 | 实测结合强度 |
| PDE | 预测距离误差,单位 Å | 结合自由能 |
| confidence_score | 用于结构样本排序的分数 | 经验证的结合概率 |
文档将 confidence_score 定义为 0.8 × complex_plddt + 0.2 × iptm,单链使用 ptm。汇总 JSON 中 pLDDT 类分数的标度为 0–1。应保留字段和文件语境,不假定所有显示的 pLDDT 标度相同。高置信度不能确定实验测定条件或实验结合。
两个亲和力输出,不同用途
affinity_probability_binary 是 0–1 的模型预测结合概率,用于区分结合分子与诱饵。它既不是结构置信度,也不能证明新筛选集上的概率已校准。affinity_pred_value 面向活性分子及其小幅修改之间的配体优化比较。两者监督来源不同,不应混成一个未区分语义的分数。
其报告标度可写为 y = log10(IC50 / µM):y = −3 对应 1 nM,y = 0 对应 1 µM,y = 2 对应 100 µM。这是单位换算示例,不是实测结果;在此约定下,y 越低表示预测结合越强。它不是 Kd。无量纲 pIC50 = 6 − y,但不能据此确定结合自由能。文档出现“pIC50 in kcal/mol”的表述,本文不采用该表述。
遵守配体适用范围
亲和力计算只能选定一个小分子配体链,以蛋白为靶标;结合实体不能是蛋白、DNA 或 RNA。文档给出最多 128 个原子的限制,计数包括重原子及 RDKit RemoveHs 保留的氢,并不建议显著超过同一计数规则下 56 原子训练上限的配体。通过输入检查不代表科学适用。以 RNA、DNA 或辅因子为靶标可能不会报错,但文档明确认为该模块的输出不可靠。
保留比较结果所需的语境
记录实体身份、化学表示、靶标序列、MSA 来源、软件版本、两类权重、采样设置及 affinity_mw_correction。使用 --use_msa_server 时会向配置的服务发送蛋白序列;本地推理不等于全程数据仅留本地。共同保存结构与亲和力输出,保留失败输入;对齐终点与设置后,再用独立实验测定证据评估。本文不声称执行过模型或实验验证。
相关资源与延伸阅读
蛋白质与结构生物学 AI 工作流:UniProt + RCSB PDB + Agent · 评估分子性质预测模型
来源与证据边界
来源检查日期为 2026-10-08。固定版本的项目文档支持能力描述,评估选择属于编辑建议。本文不报告已执行工作流、实测性能或实验验证。