AlphaFold之后:蛋白质结构预测的下一步是什么
AlphaFold之后:蛋白质结构预测的下一步是什么
2021年,AlphaFold2横空出世,在CASP14(蛋白质结构预测竞赛)中达到了接近实验精度的预测水平。《Science》将其评为年度科学突破,《Nature》称其为”改变生物学的AI”。
但AlphaFold2不是终点。
它在单体蛋白质结构预测上表现出色,但在侧链堆积、条件依赖的构象变化、生物分子相互作用等方面仍然存在局限。更重要的是,蛋白质不是静态的——它们在细胞中不断运动、折叠、相互作用,而AlphaFold2只能预测一个”静态快照”。
2026年4月,多篇论文展示了蛋白质结构预测的新方向:
- ROCKET:把实验数据(cryo-EM、cryo-ET、X-ray)整合进AlphaFold2
- RosettaSearch:用大语言模型在推理时优化蛋白质序列设计
- FlexRibbon:联合序列-结构预训练,不依赖MSA
- ProteinVista:全原子3D CNN,在结构依赖任务上超越序列transformer
蛋白质结构预测,正在从”预测静态结构”走向”整合实验数据、优化动态构象、设计新蛋白质”。
AlphaFold2的成就与局限
成就:
- 单体蛋白质结构预测接近实验精度(GDT_TS > 90)
- 预测了超过2亿个蛋白质结构(AlphaFold Protein Structure Database)
- 加速了结构生物学研究,从”结构解析需要数月”到”预测只需几分钟”
局限:
1. 侧链堆积
AlphaFold2在主链(backbone)预测上非常准确,但侧链(side chain)的精确位置仍然有误差。这对于药物设计、酶工程等需要原子级精度的应用来说,是个问题。
2. 条件依赖的构象变化
蛋白质的结构不是固定的,而是依赖于环境条件(pH、离子浓度、配体结合)。AlphaFold2预测的是”最稳定构象”,但很多蛋白质在不同条件下会采取不同构象。
3. 生物分子相互作用
AlphaFold2可以预测蛋白质复合物(AlphaFold-Multimer),但对于蛋白质-DNA、蛋白质-RNA、蛋白质-小分子的相互作用,预测精度仍然有限。
4. 训练数据的局限
AlphaFold2的训练数据主要来自PDB(Protein Data Bank),而PDB中的结构大多是”容易结晶”的蛋白质。对于膜蛋白、内在无序蛋白、大型复合物,训练数据不足。
方向1:整合实验数据——ROCKET
2026年4月1日,《Nature Methods》发表的ROCKET(Refining Optimized Coordinates with Knowledge from Experimental Techniques)提出了一个新思路:不是让AlphaFold2”从零预测”,而是让它”在实验数据的约束下优化”。
核心创新:
- 把cryo-EM、cryo-ET、X-ray晶体学数据作为”先验”(prior)
- 在AlphaFold2学到的协同进化嵌入空间(coevolutionary embedding space)中优化结构
- 而不是在笛卡尔坐标空间中优化
为什么在嵌入空间优化更好?因为AlphaFold2学到的嵌入空间编码了”生物学上合理的结构变化”——比如某个残基的侧链旋转、某个loop的构象变化。在这个空间中优化,可以捕捉到AlphaFold2单独预测时无法捕捉的生物学变异。
应用案例:
- 低信噪比cryo-EM数据:ROCKET可以从模糊的电镜密度图中提取出高质量的原子模型
- cryo-ET数据:电镜断层扫描的分辨率通常较低,ROCKET可以提升模型质量
- X-ray晶体学:对于分辨率较低的晶体结构,ROCKET可以自动构建模型
优势:
- 不需要重新训练AlphaFold2
- 可扩展到任何实验技术
- 提供了一个通用框架,用于整合实验观测和生物分子机器学习
论文链接:https://doi.org/10.1038/s41592-026-03047-4
方向2:推理时优化——RosettaSearch
2026年4月19日,arXiv发表的RosettaSearch提出了另一个思路:用大语言模型(LLM)作为生成优化器,在推理时搜索最优蛋白质序列。
背景:
- 传统的蛋白质序列设计工具(如LigandMPNN)是”单次解码”——给定一个骨架结构,模型生成一个序列,然后用结构预测模型(如RosettaFold3)评估这个序列是否能折叠成目标结构。
- 如果折叠失败,就重新生成一个序列,再评估。这是一个”试错”过程。
RosettaSearch的创新:
- 把LLM当作一个”可控的生成器”,在推理时进行多目标优化
- 用RosettaFold3计算的奖励(reward)引导LLM的搜索
- 在探索(exploration)和利用(exploitation)之间平衡
结果:
- 对400个LigandMPNN生成的次优序列,RosettaSearch恢复了高保真设计
- 结构保真度指标提升18-68%
- 设计成功率提升2.5倍
- 用独立的结构预测模型(Chai-1)验证,结果仍然稳健
- 在两个不同的LLM家族(o4-mini和Gemini-3)上都有效,性能随推理能力扩展
多模态扩展:
- RosettaSearch还可以用视觉-语言模型(VLM)
- 把预测的蛋白质结构图像作为反馈,引导序列生成
- 这相当于让模型”看着结构图”来设计序列
论文链接:https://arxiv.org/abs/2604.17175
方向3:联合序列-结构预训练——FlexRibbon
2026年4月23日,一篇快速综述介绍了FlexRibbon,一个联合学习蛋白质序列和3D结构的预训练模型。
背景:
- 序列语言模型(如ESM-2)从大规模序列数据中学习,但缺乏结构信息
- MSA-based预测器(如AlphaFold2)依赖同源序列,在高突变或alignment-sparse区域表现不佳
FlexRibbon的创新:
- 联合预训练策略:掩码语言模型 + 扩散去噪
- 不依赖MSA,直接从序列和结构中学习
- 训练数据:实验解析的结构 + AlphaFold2预测的结构
优势:
- 捕捉全局折叠和柔性构象
- 在12个不同任务上达到SOTA
- 在高突变区域(如抗体CDR loop)表现尤其好——这是MSA-based方法的弱点
应用:
- 界面设计(interface design)
- 分子间相互作用预测
- 蛋白质功能预测
论文链接:https://liner.com/review/flexribbon-joint-sequence-and-structure-pretraining-for-protein-modeling
方向4:全原子3D CNN——ProteinVista
传统的蛋白质表示方法有两种:
- 序列表示:把蛋白质当作一维字符串(氨基酸序列)
- 粗粒化结构表示:用Cα原子或残基质心表示蛋白质
但很多生物学问题需要原子级细节——比如酶的活性位点、药物结合口袋、转运蛋白的底物通道。
ProteinVista提出了一个全原子3D CNN,直接在体素化的蛋白质结构上学习。
核心思路:
- 把每个原子映射到3D体素网格
- 用3D卷积神经网络提取特征
- 在~500,000个AlphaFold2结构上预训练
优势:
- 参数量只有123M(vs ESM-2的650M)
- 在结构依赖任务上超越序列transformer:
- 酶-底物分类
- 转运蛋白-底物分类
- 药物-靶点抑制预测
- 与ESM-2的简单集成可以进一步提升精度,说明序列和结构信号部分互补
论文链接:https://openreview.net/pdf?id=2cq8FyBfDk
方向5:RNA结构预测——trRosettaRNA
蛋白质不是唯一需要结构预测的生物分子。RNA也折叠成3D结构来执行功能——从核糖体到剪接体,从tRNA到lncRNA。
2026年4月8日,《Nature Protocols》发表了trRosettaRNA服务器的协议,这是一个基于深度学习的RNA 3D结构预测平台。
核心方法:
- 端到端神经网络,自动预测RNA 3D结构
- 输入:核苷酸序列(可选:多序列比对和二级结构)
- 输出:3D结构 + 能量优化(解决结构违规)
应用:
- 预测Rfam家族中缺乏已知3D结构的RNA
- 高置信度预测与后续实验观测一致
性能:
- 中位时间:约1小时(~200个核苷酸的RNA,5个CPU核心并行)
开源:
论文链接:https://doi.org/10.1038/s41596-026-01356-8
挑战:动态构象采样
所有这些方法都在解决AlphaFold2的局限,但有一个根本问题仍然没有解决:动态构象采样。
蛋白质不是静态的。它们在细胞中不断运动,采样多个构象。这些构象之间的转换,往往是蛋白质功能的关键——比如:
- 酶的活性位点在”开放”和”关闭”之间切换
- 受体蛋白在配体结合前后改变构象
- 分子马达在ATP水解过程中经历多个中间态
AlphaFold2(以及大多数结构预测方法)只能预测”最稳定构象”。如何预测蛋白质的构象集合(conformational ensemble),仍然是一个开放问题。
可能的方向:
- 分子动力学模拟 + 机器学习:用AlphaFold2预测初始结构,然后用MD模拟采样构象空间
- 生成模型:用扩散模型或流模型生成多个构象
- 实验数据引导:用NMR、SAXS等实验数据约束构象集合
展望:混合物理-AI框架
2026年的趋势是:不再把机器学习和物理模拟对立起来,而是把它们结合起来。
混合框架的优势:
- 机器学习快速生成候选结构
- 物理模拟精细优化和验证
- 实验数据提供约束和反馈
案例:
- ROCKET:AlphaFold2 + 实验数据
- RosettaSearch:LLM + RosettaFold3
- 未来可能的方向:AlphaFold2 + 分子动力学 + cryo-EM
这种混合框架的核心思想是:机器学习不是要替代物理和实验,而是要和它们协同工作。
为什么这件事重要
蛋白质结构预测不是一个”已经解决”的问题。AlphaFold2是一个里程碑,但不是终点。
未解决的问题:
- 如何预测动态构象
- 如何预测蛋白质-配体复合物
- 如何预测膜蛋白在膜环境中的结构
- 如何预测内在无序蛋白的构象集合
- 如何预测大型复合物(如核孔复合体、剪接体)
应用需求:
- 药物设计:需要原子级精度的结合口袋结构
- 酶工程:需要理解活性位点的动态变化
- 合成生物学:需要设计全新的蛋白质功能
- 疾病机制:需要理解突变如何改变蛋白质结构和功能
2026年的这些进展——ROCKET、RosettaSearch、FlexRibbon、ProteinVista、trRosettaRNA——都在推动结构预测从”静态快照”走向”动态理解”,从”单一模态”走向”多模态整合”,从”预测”走向”设计”。
AlphaFold2打开了一扇门。接下来的问题是:我们能走多远?
参考文献:
Fadini, A., Li, M., McCoy, A.J. et al. AlphaFold as a prior: experimental structure determination conditioned on a pretrained neural network. Nat. Methods 23, 785–795 (2026). https://doi.org/10.1038/s41592-026-03047-4
RosettaSearch: Multi-Objective Inference-Time Search for Protein Sequence Design. arXiv (2026). https://arxiv.org/abs/2604.17175
FlexRibbon: Joint Sequence and Structure Pretraining for Protein Modeling. Quick Review (2026). https://liner.com/review/flexribbon-joint-sequence-and-structure-pretraining-for-protein-modeling
ProteinVista: A Compute-Efficient Atom-Level Protein Encoder. Under review at ICLR 2026. https://openreview.net/pdf?id=2cq8FyBfDk
Wang, W., Liu, X., Peng, Z. et al. The trRosettaRNA server for RNA structure prediction. Nat. Protoc. (2026). https://doi.org/10.1038/s41596-026-01356-8
Jumper, J. et al. Highly accurate protein structure prediction with AlphaFold. Nature 596, 583–589 (2021).
Baek, M. et al. Accurate prediction of protein structures and interactions using a three-track neural network. Science 373, 871–876 (2021).