AlphaFold之后:蛋白质结构预测的下一步是什么

2021年,AlphaFold2横空出世,在CASP14(蛋白质结构预测竞赛)中达到了接近实验精度的预测水平。《Science》将其评为年度科学突破,《Nature》称其为”改变生物学的AI”。

但AlphaFold2不是终点。

它在单体蛋白质结构预测上表现出色,但在侧链堆积、条件依赖的构象变化、生物分子相互作用等方面仍然存在局限。更重要的是,蛋白质不是静态的——它们在细胞中不断运动、折叠、相互作用,而AlphaFold2只能预测一个”静态快照”。

2026年4月,多篇论文展示了蛋白质结构预测的新方向:

  • ROCKET:把实验数据(cryo-EM、cryo-ET、X-ray)整合进AlphaFold2
  • RosettaSearch:用大语言模型在推理时优化蛋白质序列设计
  • FlexRibbon:联合序列-结构预训练,不依赖MSA
  • ProteinVista:全原子3D CNN,在结构依赖任务上超越序列transformer

蛋白质结构预测,正在从”预测静态结构”走向”整合实验数据、优化动态构象、设计新蛋白质”。


AlphaFold2的成就与局限

成就

  • 单体蛋白质结构预测接近实验精度(GDT_TS > 90)
  • 预测了超过2亿个蛋白质结构(AlphaFold Protein Structure Database)
  • 加速了结构生物学研究,从”结构解析需要数月”到”预测只需几分钟”

局限

1. 侧链堆积

AlphaFold2在主链(backbone)预测上非常准确,但侧链(side chain)的精确位置仍然有误差。这对于药物设计、酶工程等需要原子级精度的应用来说,是个问题。

2. 条件依赖的构象变化

蛋白质的结构不是固定的,而是依赖于环境条件(pH、离子浓度、配体结合)。AlphaFold2预测的是”最稳定构象”,但很多蛋白质在不同条件下会采取不同构象。

3. 生物分子相互作用

AlphaFold2可以预测蛋白质复合物(AlphaFold-Multimer),但对于蛋白质-DNA、蛋白质-RNA、蛋白质-小分子的相互作用,预测精度仍然有限。

4. 训练数据的局限

AlphaFold2的训练数据主要来自PDB(Protein Data Bank),而PDB中的结构大多是”容易结晶”的蛋白质。对于膜蛋白、内在无序蛋白、大型复合物,训练数据不足。


方向1:整合实验数据——ROCKET

2026年4月1日,《Nature Methods》发表的ROCKET(Refining Optimized Coordinates with Knowledge from Experimental Techniques)提出了一个新思路:不是让AlphaFold2”从零预测”,而是让它”在实验数据的约束下优化”。

核心创新

  • 把cryo-EM、cryo-ET、X-ray晶体学数据作为”先验”(prior)
  • 在AlphaFold2学到的协同进化嵌入空间(coevolutionary embedding space)中优化结构
  • 而不是在笛卡尔坐标空间中优化

为什么在嵌入空间优化更好?因为AlphaFold2学到的嵌入空间编码了”生物学上合理的结构变化”——比如某个残基的侧链旋转、某个loop的构象变化。在这个空间中优化,可以捕捉到AlphaFold2单独预测时无法捕捉的生物学变异。

应用案例

  • 低信噪比cryo-EM数据:ROCKET可以从模糊的电镜密度图中提取出高质量的原子模型
  • cryo-ET数据:电镜断层扫描的分辨率通常较低,ROCKET可以提升模型质量
  • X-ray晶体学:对于分辨率较低的晶体结构,ROCKET可以自动构建模型

优势

  • 不需要重新训练AlphaFold2
  • 可扩展到任何实验技术
  • 提供了一个通用框架,用于整合实验观测和生物分子机器学习

论文链接https://doi.org/10.1038/s41592-026-03047-4


方向2:推理时优化——RosettaSearch

2026年4月19日,arXiv发表的RosettaSearch提出了另一个思路:用大语言模型(LLM)作为生成优化器,在推理时搜索最优蛋白质序列。

背景

  • 传统的蛋白质序列设计工具(如LigandMPNN)是”单次解码”——给定一个骨架结构,模型生成一个序列,然后用结构预测模型(如RosettaFold3)评估这个序列是否能折叠成目标结构。
  • 如果折叠失败,就重新生成一个序列,再评估。这是一个”试错”过程。

RosettaSearch的创新

  • 把LLM当作一个”可控的生成器”,在推理时进行多目标优化
  • 用RosettaFold3计算的奖励(reward)引导LLM的搜索
  • 在探索(exploration)和利用(exploitation)之间平衡

结果

  • 对400个LigandMPNN生成的次优序列,RosettaSearch恢复了高保真设计
  • 结构保真度指标提升18-68%
  • 设计成功率提升2.5倍
  • 用独立的结构预测模型(Chai-1)验证,结果仍然稳健
  • 在两个不同的LLM家族(o4-mini和Gemini-3)上都有效,性能随推理能力扩展

多模态扩展

  • RosettaSearch还可以用视觉-语言模型(VLM)
  • 把预测的蛋白质结构图像作为反馈,引导序列生成
  • 这相当于让模型”看着结构图”来设计序列

论文链接https://arxiv.org/abs/2604.17175


方向3:联合序列-结构预训练——FlexRibbon

2026年4月23日,一篇快速综述介绍了FlexRibbon,一个联合学习蛋白质序列和3D结构的预训练模型。

背景

  • 序列语言模型(如ESM-2)从大规模序列数据中学习,但缺乏结构信息
  • MSA-based预测器(如AlphaFold2)依赖同源序列,在高突变或alignment-sparse区域表现不佳

FlexRibbon的创新

  • 联合预训练策略:掩码语言模型 + 扩散去噪
  • 不依赖MSA,直接从序列和结构中学习
  • 训练数据:实验解析的结构 + AlphaFold2预测的结构

优势

  • 捕捉全局折叠和柔性构象
  • 在12个不同任务上达到SOTA
  • 在高突变区域(如抗体CDR loop)表现尤其好——这是MSA-based方法的弱点

应用

  • 界面设计(interface design)
  • 分子间相互作用预测
  • 蛋白质功能预测

论文链接https://liner.com/review/flexribbon-joint-sequence-and-structure-pretraining-for-protein-modeling


方向4:全原子3D CNN——ProteinVista

传统的蛋白质表示方法有两种:

  • 序列表示:把蛋白质当作一维字符串(氨基酸序列)
  • 粗粒化结构表示:用Cα原子或残基质心表示蛋白质

但很多生物学问题需要原子级细节——比如酶的活性位点、药物结合口袋、转运蛋白的底物通道。

ProteinVista提出了一个全原子3D CNN,直接在体素化的蛋白质结构上学习。

核心思路

  • 把每个原子映射到3D体素网格
  • 用3D卷积神经网络提取特征
  • 在~500,000个AlphaFold2结构上预训练

优势

  • 参数量只有123M(vs ESM-2的650M)
  • 在结构依赖任务上超越序列transformer:
    • 酶-底物分类
    • 转运蛋白-底物分类
    • 药物-靶点抑制预测
  • 与ESM-2的简单集成可以进一步提升精度,说明序列和结构信号部分互补

论文链接https://openreview.net/pdf?id=2cq8FyBfDk


方向5:RNA结构预测——trRosettaRNA

蛋白质不是唯一需要结构预测的生物分子。RNA也折叠成3D结构来执行功能——从核糖体到剪接体,从tRNA到lncRNA。

2026年4月8日,《Nature Protocols》发表了trRosettaRNA服务器的协议,这是一个基于深度学习的RNA 3D结构预测平台。

核心方法

  • 端到端神经网络,自动预测RNA 3D结构
  • 输入:核苷酸序列(可选:多序列比对和二级结构)
  • 输出:3D结构 + 能量优化(解决结构违规)

应用

  • 预测Rfam家族中缺乏已知3D结构的RNA
  • 高置信度预测与后续实验观测一致

性能

  • 中位时间:约1小时(~200个核苷酸的RNA,5个CPU核心并行)

开源

论文链接https://doi.org/10.1038/s41596-026-01356-8


挑战:动态构象采样

所有这些方法都在解决AlphaFold2的局限,但有一个根本问题仍然没有解决:动态构象采样

蛋白质不是静态的。它们在细胞中不断运动,采样多个构象。这些构象之间的转换,往往是蛋白质功能的关键——比如:

  • 酶的活性位点在”开放”和”关闭”之间切换
  • 受体蛋白在配体结合前后改变构象
  • 分子马达在ATP水解过程中经历多个中间态

AlphaFold2(以及大多数结构预测方法)只能预测”最稳定构象”。如何预测蛋白质的构象集合(conformational ensemble),仍然是一个开放问题。

可能的方向

  • 分子动力学模拟 + 机器学习:用AlphaFold2预测初始结构,然后用MD模拟采样构象空间
  • 生成模型:用扩散模型或流模型生成多个构象
  • 实验数据引导:用NMR、SAXS等实验数据约束构象集合

展望:混合物理-AI框架

2026年的趋势是:不再把机器学习和物理模拟对立起来,而是把它们结合起来。

混合框架的优势

  • 机器学习快速生成候选结构
  • 物理模拟精细优化和验证
  • 实验数据提供约束和反馈

案例

  • ROCKET:AlphaFold2 + 实验数据
  • RosettaSearch:LLM + RosettaFold3
  • 未来可能的方向:AlphaFold2 + 分子动力学 + cryo-EM

这种混合框架的核心思想是:机器学习不是要替代物理和实验,而是要和它们协同工作


为什么这件事重要

蛋白质结构预测不是一个”已经解决”的问题。AlphaFold2是一个里程碑,但不是终点。

未解决的问题

  • 如何预测动态构象
  • 如何预测蛋白质-配体复合物
  • 如何预测膜蛋白在膜环境中的结构
  • 如何预测内在无序蛋白的构象集合
  • 如何预测大型复合物(如核孔复合体、剪接体)

应用需求

  • 药物设计:需要原子级精度的结合口袋结构
  • 酶工程:需要理解活性位点的动态变化
  • 合成生物学:需要设计全新的蛋白质功能
  • 疾病机制:需要理解突变如何改变蛋白质结构和功能

2026年的这些进展——ROCKET、RosettaSearch、FlexRibbon、ProteinVista、trRosettaRNA——都在推动结构预测从”静态快照”走向”动态理解”,从”单一模态”走向”多模态整合”,从”预测”走向”设计”。

AlphaFold2打开了一扇门。接下来的问题是:我们能走多远?


参考文献

  1. Fadini, A., Li, M., McCoy, A.J. et al. AlphaFold as a prior: experimental structure determination conditioned on a pretrained neural network. Nat. Methods 23, 785–795 (2026). https://doi.org/10.1038/s41592-026-03047-4

  2. RosettaSearch: Multi-Objective Inference-Time Search for Protein Sequence Design. arXiv (2026). https://arxiv.org/abs/2604.17175

  3. FlexRibbon: Joint Sequence and Structure Pretraining for Protein Modeling. Quick Review (2026). https://liner.com/review/flexribbon-joint-sequence-and-structure-pretraining-for-protein-modeling

  4. ProteinVista: A Compute-Efficient Atom-Level Protein Encoder. Under review at ICLR 2026. https://openreview.net/pdf?id=2cq8FyBfDk

  5. Wang, W., Liu, X., Peng, Z. et al. The trRosettaRNA server for RNA structure prediction. Nat. Protoc. (2026). https://doi.org/10.1038/s41596-026-01356-8

  6. Jumper, J. et al. Highly accurate protein structure prediction with AlphaFold. Nature 596, 583–589 (2021).

  7. Baek, M. et al. Accurate prediction of protein structures and interactions using a three-track neural network. Science 373, 871–876 (2021).