扩散模型能造蛋白质,GAN 能造分子——生成式 AI 正在接管生物设计
扩散模型能造蛋白质,GAN 能造分子——生成式 AI 正在接管生物设计
在前面三个批次中,我们分别讨论了 Transformer、CNN 和 RNN/LSTM 在生物信息学中的应用。这些架构的共同特点是:它们主要是用来”分析”数据的——从已有数据中提取模式、做出预测、进行分类。
从今天开始,我们进入一个不太一样的领域:生成式模型。 这类模型不只是分析已有的蛋白质或分子,而是要创造出自然界中不存在的全新分子。
这是一个本质性的范式转变。分析式模型回答”这个东西是什么”,生成式模型回答”我们能不能造出一个新的东西”。
从分析到生成:为什么要造新的分子
在药物设计和蛋白质工程中,研究者面临的核心问题不是”理解已有分子的性质”,而是”找到具有特定功能的新分子”。
传统的做法是定向进化(directed evolution)——随机突变、筛选、迭代。这个方法拿过 2018 年的诺贝尔化学奖(Frances Arnold),但它的搜索空间极其有限:一个 100 个氨基酸的蛋白质有 20^100 种可能的序列,随机搜索几乎不可能覆盖。
生成式模型提供了一种不同的策略: 先从已知分子的数据中学习”什么样的分子是合理的”,然后在学习到的分布中采样,直接生成候选分子。这相当于把搜索空间从”大海捞针”缩小到”在一个经过筛选的池子里挑”。
两大路线:GAN 和扩散模型
当前生成式生物分子设计的两大主流路线是 GAN(生成对抗网络)和扩散模型(diffusion model)。它们的思路不同,各有适用场景。
GAN 的思路是”对抗训练”。 它有两个网络:一个生成器负责造假分子,一个判别器负责区分真假。两者在对抗中不断进步,最终生成器能造出以假乱真的分子。在生物领域,GAN 早期被用于小分子药物生成——给定目标蛋白质的结合口袋,生成能与之匹配的候选药物分子。
扩散模型的思路是”逐步去噪”。 先给一个随机噪声,然后一步步去除噪声,最终得到一个清晰的分子结构。这个过程类似于雕塑——从一块粗糙的石料中逐步雕出精细的形状。扩散模型在蛋白质骨架生成、蛋白质序列设计等任务上展示出了比 GAN 更稳定、更多样化的生成能力。
Flow Matching 是扩散模型的一个变体,它通过学习一个连续的”流动场”来将噪声分布映射到数据分布。相比标准扩散模型,Flow Matching 的训练更稳定,生成速度更快。近期它在蛋白质设计领域引起了越来越多的关注。
最近一周发生了什么
2026 年 4 月上旬,有三项工作代表了这个方向的最新进展:
CAGenMol(Li 等,2026 年 4 月 13 日,arXiv) 提出了一种条件感知的扩散语言模型,用于目标导向的分子生成。它能同时处理多种异构约束——比如蛋白质-配体兼容性、多目标药物性质优化——而不需要逐个优化。这个方法试图解决一个实际难题:真实药物设计中,你需要的不只是”能和靶点结合”的分子,还需要”安全性好、代谢稳定、可合成”的分子,而这些目标之间往往存在冲突。
General Multimodal Protein Design(Rector-Brooks 等,2026 年 4 月 6 日,arXiv) 来自 Yoshua Bengio 的研究组,提出了一种多模态生成模型,使得化学反应可以被 DNA 编码。这项工作的核心想法是:利用自然进化产生的蛋白质多样性作为训练数据,再用生成模型扩展到进化尚未探索的化学空间。
EvoFlows(Deutschmann 等,2026 年 4 月 8 日,arXiv) 提出了一种基于 Flow Matching 的蛋白质工程编辑模型。与从零生成不同,EvoFlows 专注于”在已有蛋白质的基础上做有意义的修改”——这更接近实际蛋白质工程的工作方式:你不是从一张白纸开始,而是在已有功能的蛋白质上做改进。
它们做到了什么,还没做到什么
这些生成式模型已经能做到的事情包括:
- 在给定靶点的情况下,生成具有合理结合构象的候选分子
- 在蛋白质骨架层面生成结构多样的全新骨架
- 在特定约束条件下(如稳定性、溶解度)进行有方向的分子优化
但它们的局限同样需要认真对待:
第一,”能生成”不等于”能用”。 模型生成的分子在计算上可能看起来合理,但在真实生物体系中的表现——活性、毒性、药代动力学——仍然需要湿实验验证。生成式模型的价值在于缩小搜索空间,而不是替代实验。
第二,训练数据的偏差会传递到生成结果。 目前的模型大多在已知蛋白质或已知药物分子的数据上训练。对于训练数据覆盖不足的化学空间(比如全新骨架、非天然氨基酸),生成质量可能下降。
第三,多目标优化仍然困难。 真实药物设计需要同时优化多个互相冲突的目标。虽然 CAGenMol 等方法在尝试解决这个问题,但距离实用的多目标药物优化还有距离。
第四,可解释性不足。 生成式模型通常是一个黑箱——它给你一个分子,但不容易解释”为什么这个分子是好的”。这在需要向药物监管机构解释设计逻辑的场景中是一个问题。
和前面三个批次的关系
如果我们回顾整个系列的逻辑,可以看到一条清晰的线索:
Transformer 擅长全局模式识别——用在蛋白质语言模型、DNA 语言模型上,从大规模序列数据中提取通用的生物学表示。
CNN 擅长局部特征提取——用在转录因子结合位点预测、蛋白质二级结构识别上,捕捉 DNA motif 和蛋白质局部模式。
RNN 擅长顺序依赖建模——用在细胞轨迹推断、基因表达时间序列预测上,处理具有时间维度的生物数据。
GAN/扩散模型则进入了一个新维度:生成。 它们不再只是理解和预测已有数据,而是创造新的数据。这在药物设计、蛋白质工程、合成生物学中有直接的应用价值。
但生成和分析不是对立的。在实际的分子设计流程中,生成式模型负责”提出候选”,分析式模型负责”评估候选”,湿实验负责”验证候选”。这是一个协作链条,不是替代关系。
对不同读者意味着什么
如果你在做蛋白质工程或药物设计: 生成式模型正在成为这个领域的标准工具之一。但选择哪种方法(GAN、扩散模型、Flow Matching、自回归模型)取决于你的具体需求——是从头生成还是在已有分子上修改?是单目标还是多目标?数据量够不够支撑训练?了解每种方法的适用边界,比追逐最新方法更重要。
如果你在跟踪 AI 技术趋势: 生成式模型在生物领域的应用可能是当前 AI 最有实际落地潜力的方向之一。它不像大语言模型那样有”通用智能”的叙事,但它在解决具体的、有经济价值的问题——设计更好的药物、更高效的酶、更稳定的蛋白质。
如果你是这个系列的读者: 从 Transformer 到 CNN 到 RNN 再到生成式模型,这个系列讨论的不是”哪种架构最好”,而是”不同的生物问题需要不同的计算工具”。下一篇文章将深入讨论生成式模型在蛋白质设计中的具体代表工作。
参考文献
- Li, Y. et al. (2026). CAGenMol: Condition-Aware Diffusion Language Model for Goal-Directed Molecular Generation. arXiv preprint.
- Rector-Brooks, J. et al. (2026). General Multimodal Protein Design Enables DNA-Encoding of Chemistry. arXiv preprint.
- Deutschmann, N. et al. (2026). EvoFlows: Evolutionary Edit-Based Flow-Matching for Protein Engineering. arXiv preprint.
- Wanasekara, S.H. et al. (2026). Generative Modeling in Protein Design: Neural Representations, Conditional Generation, and Evaluation Standards. arXiv preprint.