新闻详情

新闻详情

首页 / 资讯中心 / 详情

RFdiffusion+ProteinMPNN:抗体从头设计实战指南

发布时间:2026/10/1 23:36:15来源:尧图网络
RFdiffusion+ProteinMPNN:抗体从头设计实战指南
1. 抗体从头设计的整体思路与工具选型1.1 为什么传统抗体发现路线开始“不够用”做抗体的人都知道传统路线无非几条免疫动物、杂交瘤筛选、噬菌体展示、单B细胞克隆。这些方法成熟、可靠但有一个共同的“天花板”——你只能在自然界已经存在的抗体序列空间里做筛选。换句话说你是在“找”抗体而不是在“造”抗体。找就意味着受限于免疫系统的耐受机制、免疫原性、物种差异以及那些难以激发免疫反应的靶点比如高度保守的自身抗原、小分子半抗原、某些离子通道蛋白。很多做药的朋友应该深有体会一个靶点筛了两三年拿到的候选分子要么亲和力上不去要么稳定性差要么表达量低得可怜最后项目黄了不是 science 不行是分子本身“底子”不好。从头设计de novo design换了一个思路不找了直接算。给定一个靶点表位我用算法生成一个能结合它的蛋白骨架再优化序列让它折叠成我想要的结构。这条路如果走通理论上可以针对任何靶点、任何表位设计出自然界不存在的全新抗体。RFdiffusion ProteinMPNN 这套组合就是目前这条路上最被验证、最容易上手的方案之一。1.2 RFdiffusion 和 ProteinMPNN 各自扮演什么角色这两个工具的分工非常清晰你可以把它们理解成“画图纸”和“填材料”的关系。RFdiffusion是一个基于扩散模型的蛋白结构生成网络。它的核心能力是给定一个靶点蛋白的结构或者只是骨架坐标它能“扩散”出一个新的蛋白骨架这个骨架在空间上能跟靶点形成互补的接触面。对于抗体设计RFdiffusion 特别适合生成那种“小尺寸、β-折叠为主、带有特定结合环区”的骨架这正好是抗体可变区Fv的典型特征。ProteinMPNN则是一个序列设计网络。它拿到 RFdiffusion 生成的骨架坐标后反向推断出什么样的氨基酸序列最有可能折叠成这个结构。它的优势在于速度快、对骨架的兼容性好、能同时考虑多个链之间的相互作用。对于抗体这种需要重链和轻链协同折叠的体系ProteinMPNN 可以固定框架区、只设计 CDR 区也可以全序列设计。我个人的经验是RFdiffusion 决定“能不能结合”ProteinMPNN 决定“能不能折叠、能不能表达”。两者缺一不可但优化的侧重点完全不同。1.3 这套流程适合谁、不适合谁先说适合的如果你手头有一个结构已知的靶点蛋白哪怕是 AlphaFold2 预测的想针对某个特定表位快速生成一批候选结合蛋白而且你有基本的 Linux 操作能力和 GPU 资源那这套流程非常适合你。它不需要你懂深度学习只需要你会跑脚本、会看输出、会做基本的筛选。不适合的情况也很明确如果你连靶点结构都没有或者靶点是一个高度灵活的膜蛋白、没有可靠的实验结构那 RFdiffusion 的输入质量就会很差输出基本靠运气。另外如果你期望“跑一次就拿到纳摩尔级亲和力的抗体”那也不现实——这套流程生成的是候选分子后续还需要湿实验验证和亲和力成熟。2. 环境搭建与输入准备的实操细节2.1 硬件和软件环境的最低要求RFdiffusion 对 GPU 显存的要求不算特别高但也不是随便一张卡就能跑。根据我的实测生成一个 100 残基左右的骨架至少需要 8GB 显存推荐 16GB 以上比如 RTX 4090、A5000、V100。如果你要同时跑多个设计或者生成更大的体系24GB 会更从容。软件环境方面官方推荐用 conda 管理依赖。我建议单独建一个环境避免和已有的 PyTorch 环境冲突。核心依赖包括Python 3.9 或 3.10PyTorch 1.13 或 2.0需要和 CUDA 版本匹配SE3TransformerRFdiffusion 的底层等变网络DGL图神经网络库ProteinMPNN 本身依赖比较简单主要是 PyTorch 和 NumPy注意RFdiffusion 的安装过程中最容易出问题的是 SE3Transformer 的编译。如果你用的是较新的 CUDA 版本比如 12.x可能需要手动调整编译选项。我的建议是直接用官方提供的 conda 环境文件能省掉大量排查时间。2.2 靶点结构的获取与预处理RFdiffusion 需要一个干净的靶点结构作为输入。来源可以是 PDB 数据库的实验结构也可以是 AlphaFold2/AlphaFold3 的预测结构。不管来源是什么预处理步骤都差不多去水、去配体、去多余链只保留你关心的靶点链。如果靶点是多链复合物保留所有参与结合的链。补全缺失残基实验结构经常有缺失的 loop 区用 MODELLER 或 PDBFixer 补全。缺失严重的区域如果正好是表位那这个结构就不能用了。确定表位残基这是最关键的一步。你需要明确告诉 RFdiffusion 你想结合在靶点的哪个位置。通常的做法是根据已知的抗体-靶点复合物结构、突变实验数据或者简单的表面可及性分析选一组连续的或离散的残基作为“热点”。格式转换RFdiffusion 接受 PDB 格式但内部会转成特定的特征表示。确保残基编号连续、没有重复原子。我踩过的一个坑有一次用 AlphaFold2 预测的靶点结构残基编号从 1 开始但实际蛋白的编号是从 100 开始的。RFdiffusion 不关心编号本身但后续分析时会对不上导致表位选择错误。所以预处理时一定要统一编号体系并在日志里记录清楚。2.3 抗体骨架的参考与约束设置虽然 RFdiffusion 可以从头生成骨架但完全无约束的生成往往得到一些“不像抗体”的东西。为了提高成功率通常会给一些约束框架区约束如果你希望生成的分子保留抗体典型的免疫球蛋白折叠可以提供一段已知的抗体框架结构作为参考让 RFdiffusion 在生成时偏向这个拓扑。CDR 长度约束抗体 CDR 的长度分布是有规律的比如 CDR H3 通常在 8-20 个残基之间。你可以在 RFdiffusion 的配置里指定生成区域的长度范围。二硫键约束抗体框架区有保守的二硫键。如果你希望保留可以在序列设计阶段用 ProteinMPNN 的约束功能固定这些半胱氨酸。这些约束不是必须的但加上之后输出的候选分子更接近“可开发”的抗体而不是随便一个结合蛋白。3. RFdiffusion 生成骨架的核心步骤与参数解析3.1 扩散模型的“加噪-去噪”到底在做什么RFdiffusion 的底层是去噪扩散概率模型DDPM。训练时它学习从蛋白结构中逐步加噪直到变成纯高斯噪声推理时它从纯噪声出发在靶点结构的“引导”下逐步去噪生成一个新的骨架。你可以把这个过程想象成雕塑一开始是一块毫无形状的石头噪声你每次凿掉一点多余的部分去噪步骤同时心里有一个目标——要雕出一个能卡住靶点表面某个凹槽的形状。RFdiffusion 的“心里目标”就是靶点的坐标和表位信息。关键参数有几个T扩散步数通常设为 50。步数越多生成质量越高但速度越慢。50 是一个比较平衡的值。噪声调度默认是 cosine 调度一般不用改。分类器引导强度这个参数控制生成结果有多“听话”地结合到指定表位。强度太低生成的东西不结合强度太高生成的结构会变得不自然。我的经验是从 1.0 开始试根据输出调整。3.2 表位条件化怎么告诉模型“结合这里”RFdiffusion 支持多种条件化方式最常用的是“motif scaffolding”模式。你把靶点结构作为 motif 输入并指定哪些残基是表位模型会生成一个能包裹这些残基的新链。具体操作上你需要准备一个 JSON 或 YAML 配置文件里面包含靶点 PDB 路径表位残基列表比如[A:45, A:46, A:48, A:70]生成链的长度范围是否固定靶点坐标通常固定提示表位残基的选择直接决定成败。如果选了一个太浅、太小的表位生成的抗体可能结合不牢如果选了一个太大、太平的表位生成的抗体可能无法形成足够的接触。我通常建议选 6-12 个残基分布在 15-20 Å 的范围内有一定的凹凸起伏。3.3 生成多个候选与初步筛选RFdiffusion 一次可以生成几十到几百个骨架。不要指望第一个就是好的。我的标准流程是跑 100-500 个设计根据 GPU 资源调整。用简单的几何指标初筛接触面积 buried surface area 、形状互补性 shape complementarity 、氢键数量。剔除明显不合理的比如生成链穿过了靶点、接触面积小于 400 Ų、或者生成了大量无规卷曲。这一步不需要太精确目的是把候选从几百个降到几十个减少后续 ProteinMPNN 和湿实验的工作量。4. ProteinMPNN 序列设计与多链协同优化4.1 序列设计的“反向折叠”逻辑ProteinMPNN 解决的问题是给定一个骨架什么序列能折叠成它它的网络架构是消息传递神经网络MPNN在蛋白结构的图表示上做信息传递每个节点是一个残基边是空间邻近关系。对于抗体设计ProteinMPNN 有几个关键优势支持多链可以同时设计重链和轻链并考虑链间相互作用。支持固定残基框架区的保守残基可以固定只设计 CDR。支持偏置可以给某些氨基酸加偏置比如避免过多的半胱氨酸或脯氨酸。我通常的做法是第一轮全序列设计看看模型倾向于什么第二轮固定框架区只设计 CDR得到更“像抗体”的序列。4.2 重链轻链的配对与界面优化抗体是一个异源二聚体重链和轻链的界面必须匹配。RFdiffusion 生成的骨架如果包含两条链ProteinMPNN 会自动考虑链间接触。但如果 RFdiffusion 只生成了一条链比如只生成重链那你就需要单独处理轻链。我的经验是尽量让 RFdiffusion 同时生成重链和轻链的骨架。虽然计算量更大但这样得到的界面更自然后续序列设计也更容易。如果分开生成重链和轻链的界面往往需要额外的优化成功率会下降。ProteinMPNN 有一个--pdb_path_chains参数可以指定哪些链一起设计。对于抗体通常设为H L表示重链和轻链联合设计。4.3 序列多样性控制与去冗余ProteinMPNN 对同一个骨架可以生成多个序列比如每个骨架生成 8-16 条序列。这些序列之间会有一定的多样性但如果你不做控制可能会得到大量高度相似的序列。控制多样性的方法温度参数ProteinMPNN 的采样温度控制随机性。温度低0.1序列更保守、更相似温度高0.5-1.0序列更多样。我通常用 0.1 做第一轮用 0.3-0.5 做后续的多样性探索。去冗余生成后用 CD-HIT 或 MMseqs2 对序列做聚类剔除相似度高于 90% 的冗余序列。氨基酸组成检查剔除那些含有过多疏水残基容易聚集或过多半胱氨酸容易形成错误二硫键的序列。5. 结构验证与候选分子排序5.1 用 AlphaFold2 做自洽性检查ProteinMPNN 输出的序列需要用结构预测工具验证这条序列能不能折叠回原来的骨架最常用的工具是 AlphaFold2。具体做法是把 ProteinMPNN 设计的序列重链轻链输入 AlphaFold2预测其结构然后和 RFdiffusion 生成的骨架做比对。评价指标RMSD预测结构和设计骨架的偏差。小于 2 Å 算合格小于 1 Å 算优秀。pLDDTAlphaFold2 的置信度。界面残基的 pLDDT 最好大于 80。PAE预测对齐误差。链间 PAE 低说明界面预测可靠。这一步会淘汰掉相当一部分设计——有些序列虽然理论上能折叠但 AlphaFold2 预测出来完全不是那个结构。这是正常的不要灰心。5.2 界面能量计算与亲和力预估结构验证通过后下一步是估算结合亲和力。常用的工具包括Rosetta用InterfaceAnalyzer计算结合能、埋藏面积、形状互补性。FoldX计算结合自由能变化。PRODIGY基于接触特征预测结合亲和力。这些工具的绝对值不一定准但可以用来排序。我的做法是用 Rosetta 算 ΔG用 PRODIGY 算 Kd 的粗略估计两者结合选排名前 10-20 的候选进入湿实验。注意计算预测的亲和力和实验值往往有 1-2 个数量级的偏差。不要因为预测值不好就放弃一个设计也不要因为预测值好就盲目乐观。最终还是要靠实验。5.3 可开发性评估表达、稳定性、免疫原性除了结合能力一个抗体能不能成为药物还要看可开发性。在计算阶段可以做一些初步筛选表达量预测用 SoluProt 或 DeepSol 预测在大肠杆菌或哺乳动物细胞中的可溶性表达概率。稳定性预测用 ThermoNet 或 Rosetta 的 ddG 计算预测热稳定性。免疫原性预测用 NetMHCII 预测是否有强结合 MHC II 的表位避免引起不必要的免疫反应。聚集倾向用 TANGO 或 AGGRESCAN 预测聚集倾向。这些工具都是辅助性的但能帮你排除一些明显有问题的候选。6. 常见问题与排查技巧实录6.1 RFdiffusion 生成结果不结合靶点怎么办这是最常见的问题。可能的原因和排查方向问题现象可能原因排查方法解决思路生成链远离靶点引导强度太低检查配置文件中的引导参数提高引导强度从 1.0 提到 2.0-3.0生成链穿过靶点表位选择不合理可视化表位残基重新选择表位避免选在靶点内部接触面积很小生成链太短或太长检查生成链长度调整长度范围通常 80-120 残基生成结果多样性低噪声调度不合适尝试不同的噪声调度改用 linear 或 sqrt 调度我个人的经验是表位选择占成功率的 70%。如果表位选得好即使其他参数一般也能得到一些合理的候选。如果表位选得不好怎么调参数都没用。6.2 ProteinMPNN 序列折叠不回去怎么处理AlphaFold2 验证时如果 RMSD 很大说明序列和骨架不匹配。可能的原因骨架本身不合理RFdiffusion 生成的骨架可能含有不合理的几何结构比如键长键角异常、原子重叠。用 MolProbity 检查骨架的几何质量。序列设计约束太少如果全序列自由设计模型可能会选一些不利于折叠的残基。尝试固定更多框架区残基。多链界面不匹配重链和轻链的界面残基如果不兼容会导致折叠失败。检查界面残基的氨基酸类型是否合理比如有没有带同种电荷的残基面对面。6.3 湿实验验证前的最后检查清单在把候选分子送去做实验之前我通常会过一遍这个清单序列有没有明显的错误比如起始密码子、终止密码子、信号肽。有没有意外的糖基化位点N-X-S/T如果有考虑突变掉。有没有过多的游离半胱氨酸抗体框架区的二硫键要保留但额外的半胱氨酸容易导致错误配对。等电点是否合适太高或太低都可能影响纯化。有没有预测的强 MHC II 结合表位如果有考虑改掉。这些检查看起来琐碎但能避免很多“做了几个月实验发现分子根本表达不出来”的悲剧。6.4 提高成功率的几个“玄学”技巧说几个我在实操中总结的、不太上得了台面但确实有用的技巧多跑几轮换随机种子RFdiffusion 的生成结果对随机种子敏感。同一个配置换个种子结果可能完全不同。我通常至少跑 3 个种子合并结果。用已知抗体做“锚定”如果你要针对的表位和某个已知抗体的表位重叠可以把已知抗体的框架作为参考让 RFdiffusion 在此基础上生成。这样成功率会高很多。CDR H3 单独处理CDR H3 是抗体多样性的主要来源也是最难设计的部分。我有时会先用 RFdiffusion 生成框架然后用专门的 loop 建模工具如 LoopBuilder单独设计 H3最后再拼起来。不要迷信计算分数我遇到过 Rosetta 分数很差但实验亲和力很好的设计也遇到过分数很好但完全不结合的。计算只是筛选实验才是真理。7. 从计算到实验的衔接与迭代7.1 基因合成与表达载体的选择计算筛选出的候选下一步是基因合成。对于抗体通常选择哺乳动物细胞表达HEK293 或 CHO因为这样能保证正确的折叠和糖基化。载体方面常用的有 pcDNA3.4、pTT5 等。如果只是做初步的结合验证也可以尝试大肠杆菌表达但抗体的二硫键在细菌中容易形成包涵体需要复性比较麻烦。我的建议是初步筛选用哺乳动物细胞瞬转确认结合后再考虑其他表达系统。7.2 结合实验的优先级排序拿到表达上清后第一轮实验通常是 ELISA 或 BLI生物膜干涉。ELISA 便宜、通量高适合初步筛选BLI 能测动力学常数适合确认阳性克隆。我通常的做法是用 ELISA 筛一遍看有没有结合信号。对 ELISA 阳性的克隆用 BLI 测亲和力。对亲和力好的克隆做稳定性测试热挑战、血清稳定性。对稳定性好的克隆做功能实验比如中和实验、细胞实验。这个顺序能帮你快速淘汰大部分不合格的候选把资源集中在最有希望的分子上。7.3 亲和力成熟与后续优化如果初步设计的抗体亲和力不够比如只有微摩尔级可以做亲和力成熟。常用的方法包括计算重设计用 ProteinMPNN 对 CDR 区做定向突变生成突变体库再用 AlphaFold2 和 Rosetta 筛选。实验进化用易错 PCR 或定点突变构建突变体库用噬菌体展示或酵母展示筛选。理性设计根据结构分析手动突变界面残基比如把疏水残基换成带电荷的残基增加静电相互作用。亲和力成熟是一个迭代过程通常需要 2-3 轮才能把亲和力提高 10-100 倍。7.4 这套流程的局限性与未来改进方向RFdiffusion ProteinMPNN 不是万能的。目前的局限性包括对靶点结构的依赖如果靶点没有可靠的结构这套流程基本没法用。对表位的依赖表位选择仍然需要人工判断自动化程度不够。亲和力上限从头设计的抗体亲和力通常不如免疫动物得到的抗体需要后续成熟。可开发性计算阶段很难完全预测表达量、稳定性、免疫原性很多候选会在实验阶段被淘汰。未来的改进方向可能包括更好的表位预测工具、更精确的亲和力预测模型、以及将可开发性评估整合到设计流程中。但就目前而言这套流程已经足够让一个有小团队、有 GPU 资源的实验室在几周内生成一批可实验验证的候选分子。我个人在实际操作中的体会是不要追求一次成功要把这套流程当成一个“候选生成器”。它的价值不在于直接给你一个完美的抗体而在于帮你快速探索巨大的序列和结构空间把湿实验的试错成本降下来。跑 500 个设计能有 5 个结合1 个有开发潜力这个效率已经比传统方法高很多了。
网站建设高端定制企业官网
RELATED

相关资讯

更多精彩内容,欢迎继续阅读

较早相关资讯

最新相关资讯

16位500KS/s异步采集卡PCIe5654在电子检测与过程控制中的应用 2026/10/2 0:15:03

16位500KS/s异步采集卡PCIe5654在电子检测与过程控制中的应用

做电子检测和过程控制的项目,手上没一块趁手的采集卡,心里总是不踏实。项目一多、信号种类一杂,更需要一块参数够用、接口全、噪声表现又稳的“万金油”级板卡。我前阵子常在产线传感器标定和数据记录任务中使用PCIe5654,16位模拟…

阅读更多 →
Simulink在HIL测试中的核心角色:Plant Model构建与实时性保障 2026/10/2 0:15:03

Simulink在HIL测试中的核心角色:Plant Model构建与实时性保障

1. HIL测试现场最常被问错的三个问题:MATLAB/Simulink到底在“跑”什么?刚接手某车企电控系统HIL台架时,我被测试工程师拉住问了三遍:“你们Simulink模型是跑在上位机还是下位机?”“Plant Model是不是就是把ECU代码反…

阅读更多 →
以太网温湿度变送器批量配置实战:双协议Modbus TCP与MQTT部署指南 2026/10/2 0:15:02

以太网温湿度变送器批量配置实战:双协议Modbus TCP与MQTT部署指南

1. 项目概述:当一台台配置跟不上几十个测点的时候先说说这个项目到底是个什么来头。做环境监测的老哥应该都有这种体会:前期选型、布线、调试单台设备都不是最难的事,真正让人头疼的是设备数量一上来,配置效率就变成了瓶颈。这次的…

阅读更多 →
Nerd Fonts 中 Monofur 补丁字体的完整使用指南:图标集成、字体家族选择与本地打补丁实战 2026/10/2 0:14:55

Nerd Fonts 中 Monofur 补丁字体的完整使用指南:图标集成、字体家族选择与本地打补丁实战

开发工具CLI 【免费下载链接】nerd-fonts Iconic font aggregator, collection, & patcher. 3,600 icons, 50 patched fonts: Hack, Source Code Pro, more. Glyph collections: Font Awesome, Material Design Icons, Octicons, & more 项目地址: https://…

阅读更多 →
社区健康管理系统毕设:Spring Boot + MyBatis Plus 完整实战指南 2026/10/2 0:14:13

社区健康管理系统毕设:Spring Boot + MyBatis Plus 完整实战指南

做毕业设计选型时,很多同学会卡在“社区健康管理系统”这种看似普通的题目上:它不是纯技术攻关型项目,也不是纯业务堆砌型项目,而是一个典型的、需要把业务逻辑和工程能力平衡好的管理系统。用Spring Boot来做这个方向&#xff0c…

阅读更多 →
LineageOS时间错乱导致网络受限?完整排查修复指南 2026/10/2 0:14:13

LineageOS时间错乱导致网络受限?完整排查修复指南

刷完 LineageOS 之后,你有没有碰到过这种鬼情况:Wi-Fi 明明连着,图标上却顶着一个感叹号;状态栏写着“已连接,无互联网”,有时候移动数据也跟着提示受限。同一部手机换个系统就正常,路由器也没毛…

阅读更多 →

今日资讯

本周资讯

本月资讯

看完文章仍有疑问?

联系尧图顾问,获取一对一建站咨询

立即免费咨询 📞 400-888-8888
📞 ✉