跳转到正文
社区

RFdiffusion 骨架生成与 ProteinMPNN 序列设计

用 RFdiffusion 生成小规模单体骨架,将 PDB 坐标传入 ProteinMPNN,并保留配对结构、序列与来源记录,供后续验证。

难度: 高级 费用: 免费 隐私: 本地 ~90 分钟
开始安装

你将能够

  • 生成可追溯的计算候选产物,并检查文档规定的验收条件。

你将构建什么

基于官方文档的审核稿。本批未执行此工作流,未验证安装、推理、优化或实验结果。

范围与读者

面向计算蛋白质设计研究人员。基线是无条件的 150 残基单体,不宣称其具有结合能力或目标功能。RFdiffusion 生成骨架坐标,设计区域的甘氨酸标签只是占位;ProteinMPNN 为检查过的骨架分配序列。本流程不包含 FastRelax、重新折叠预测或实验验证。

输入、衔接与产物

输入为长度约束、所选 RFdiffusion 权重及确切源码/环境记录。确认生成的 PDB 只有链 A,并包含普通全骨架 ProteinMPNN 模型所需的有效 N/CA/C/O 坐标。保留链编号、残基编号以及 RFdiffusion PDB/TRB 对应关系;缺失原子、编号间隙、替代构象和固定基序需要显式映射,不能盲目转换。TRB 可能包含 Python 序列化对象,只能检查可信运行产生的文件。输出包括骨架 PDB 和元数据、ProteinMPNN seqs 目录中的 FASTA、采样种子/温度及评分记录。评分表示模型偏好,不证明活性或折叠成功。

局限、成本与条款

核验到的 RFdiffusion 环境为 Python 3.9、PyTorch 1.9 和 CUDA 11.1;本次未确认现代 GPU 兼容性。ProteinMPNN 使用单独记录的环境,以文件交换衔接。GPU 时间、存储和环境配置由用户承担;安装时间估计不含推理。两者代码许可分别为 BSD-3-Clause 和 MIT;保留版权声明,并在使用前检查所选权重附带条款。软件许可不授予私有结构数据使用权,不承诺广泛操作系统或硬件支持。

官方参考

骨架生成

RFdiffusion

骨架条件下的序列设计

ProteinMPNN

组合组件

RFdiffusion

骨架生成 · source 86507b6538f51fce57b5a72477165f03999ed7ae; Base_ckpt.pt

基于官方文档的审核稿。本批未执行此工作流,未验证安装、推理、优化或实验结果。

代码开源;算力/存储及外部服务条件由用户另行承担和确认。

查看资源

ProteinMPNN

骨架条件下的序列设计 · source 8907e6671bfbfc92303b5f79c4b5e6ce47cdef57; v_48_020

基于官方文档的审核稿。本批未执行此工作流,未验证安装、推理、优化或实验结果。

代码开源;算力/存储及外部服务条件由用户另行承担和确认。

查看资源

兼容环境

客户端操作系统架构版本要求
Python Linux不限>= 3.9

安装与测试

1. 定义小规模单体设计

Linux

首次检查选择无条件 150 残基单体。准备有权使用的输入、存储、兼容算力和官方权重;原 CUDA 环境需单独审核安装。

官方来源

预期结果

形成书面目标及权重/环境前置记录。

2. 获取核验过的源码版本

Linux

在新的工作目录运行。按固定版本 RFdiffusion README 配置 SE3nv/SE3-Transformer 并放置权重;另行安装 ProteinMPNN 文档要求的 Python/PyTorch/NumPy。以下克隆命令本身不构成完整安装。

git clone https://github.com/RosettaCommons/RFdiffusion.git
git -C RFdiffusion checkout 86507b6538f51fce57b5a72477165f03999ed7ae
git clone https://github.com/dauparas/ProteinMPNN.git
git -C ProteinMPNN checkout 8907e6671bfbfc92303b5f79c4b5e6ce47cdef57
官方来源

预期结果

源码固定,两个环境完成依赖配置并分别记录。

3. 记录文件与链的衔接约定

Linux

使用全骨架 v_48_020 模型,不启用 --ca_only。保留链 A,检查 N/CA/C/O 原子及残基对应关系。若加入基序或其他链,重新设计前需明确固定位置/链策略。

官方来源

预期结果

检查后的单链 PDB 可传给官方 --pdb_path 接口。

4. 生成一个候选骨架

Linux

先激活已配置的 RFdiffusion 环境,生成一个小样本并检查文件;命令结束不代表科学目标成功。

cd RFdiffusion
./scripts/run_inference.py 'contigmap.contigs=[150-150]' inference.output_prefix=review_outputs/backbone inference.num_designs=1
官方来源

预期结果

预期产物为 RFdiffusion/review_outputs/backbone_0.pdb 及对应 TRB,包含 150 个设计残基;本次未实际观察输出。

5. 从已检查 PDB 设计序列

Linux

回到父工作目录并激活 ProteinMPNN 环境。完成链/原子检查后传入实际 PDB;种子 37 和温度 0.1 是明确选定的演示设置。

python ProteinMPNN/protein_mpnn_run.py --pdb_path RFdiffusion/review_outputs/backbone_0.pdb --pdb_path_chains A --out_folder sequence_outputs --num_seq_per_target 2 --sampling_temp 0.1 --seed 37 --model_name v_48_020
官方来源

预期结果

预期 sequence_outputs/seqs 下产生 FASTA,包含采样序列和模型/种子/评分来源。核对采样数量和 150 残基长度;参考条目不算新设计。

故障排除

  • 依赖/CUDA 失败:采用固定上游环境并审核实际驱动/设备,不默默混用环境。
  • 骨架缺失:检查 RFdiffusion 日志和权重位置。
  • 解析错误:检查链 A、残基编号和完整骨架原子;修复输入时保留映射。
  • 显存不足:缩小设计批量并保留错误。
  • FASTA 不一致:区分参考和采样序列,逐条对应骨架;较低模型评分并非验证结论。
仍无法运行

替代方案

另行审核的 ProteinMPNN-FastRelax 可作为扩展,但不等于本流程已执行的步骤;本基线止于骨架/序列配对。