蛋白质语言模型真的和语言模型一样吗?

这个问题看起来有点奇怪。蛋白质语言模型(Protein Language Model,PLM)本身就是从自然语言处理里的Transformer架构借过来的——BERT、GPT 这些模型被用来处理氨基酸序列。所以如果有人问”它们有什么不同”,听起来像是在问”一把钥匙和另一把钥匙有什么不同”。

但最近有一篇论文系统地研究了这个问题,发现答案没那么简单。


这篇论文叫 “Protein Language Models Diverge from Natural Language: Comparative Analysis and Improved Inference”,2026年2月23日提交到arXiv,作者是Anna Hart、Chi Han等人,来自伊利诺伊大学厄本那-香槟分校和俄勒冈大学。

研究的核心问题是:把一个为自然语言设计的Transformer架构直接拿来处理蛋白质序列,这个过程中有什么东西悄悄改变了?


先说一个背景。蛋白质由20种氨基酸组成,氨基酸序列本质上也是一个”句子”——每个位置有一个token(氨基酸),整个序列有语法结构(蛋白质的折叠规律)。所以研究者很自然地认为:既然NLP领域已经证明了Transformer在处理序列数据上的强大能力,把它用到蛋白质上应该也很有效。

这确实work了。ESM、ProtBERT、ProtT5这些蛋白质语言模型在各种任务上表现很好——蛋白质结构预测、功能注释、突变效应预测等等。

但这篇论文指出:模型表现好,不意味着它处理信息的方式和人一样。


研究者比较了两种模型族在信息分布上的差异:自然语言模型(如BERT)和蛋白质语言模型(如ESM)。

具体做法是:分析每一层、每个attention head里信息存储的方式有什么不同。

结果发现,蛋白质语言模型的信息存储模式与自然语言模型有显著差异。

在自然语言模型里,信息往往集中在某几层、某几个特定的head里。底层的attention负责捕捉局部的语法结构,中层的attention捕捉句法关系,高层的attention负责语义。

但在蛋白质语言模型里,这种层次化的信息组织模式被打破了。研究者发现,蛋白质模型的信息分布更加”平坦”——不同层之间的差异没那么明显,而且很多head都在做类似的事情。

这个差异的原因可能和蛋白质序列本身的特性有关。蛋白质只有20种氨基酸,而自然语言的词汇量通常有几万个。这意味着:同样的维度下,蛋白质模型的”词表”更紧凑,但每个氨基酸承担的语义信息密度更高——一个位置的变化可能直接导致整个蛋白质失去功能。


这个发现有一个实际的用处。

在NLP领域,有一个叫”early exit”的技术:不需要跑完整个模型,而是在中间的某一层就停止,把那一层的表示直接拿出来做下游任务。这可以加速推理,但代价是性能会下降——因为早期的层表示不如最后的层”丰富”。

研究者把这个技术应用到蛋白质语言模型上,发现了一个奇怪的现象:同样的early exit技术,在蛋白质模型上反而能提升性能。

具体来说,他们在多个蛋白质功能预测任务上测试了early exit——不是从第一层跑到最后一层,而是在中间某层就停止做预测。结果:相比用最后一层的表示,直接用中间层的表示来做预测,准确率反而提高了0.4到7.01个百分点,同时推理时间减少了10%以上。

为什么会这样?论文的解释是:蛋白质模型的不同层存储的信息差异没那么大,而且不同蛋白质在不同任务上”最有用”的层不一样。用early exit让模型可以自动选择每个蛋白质在自己的任务上最合适的表示层,而不是一刀切地用最后一层。


这个发现的意义不只是”加速”那么简单。它揭示了一个更根本的问题:蛋白质语言模型和自然语言模型需要不同的使用策略。

对于自然语言模型,用最后一层的表示通常是最安全的——因为信息在层层传递中逐渐抽象化,最后一层包含最丰富的语义。对于蛋白质模型,可能需要针对具体任务来做选择——有的任务用浅层表示就够了,有的任务需要更深的层。

对于做蛋白质相关应用的研究者来说,这篇论文提供了一个实用的建议:不要假设NLP领域的最佳实践可以直接迁移到蛋白质领域。多试试不同的层,可能会有惊喜。


参考文献

  • Protein Language Models Diverge from Natural Language: Comparative Analysis and Improved Inference. Anna Hart, Chi Han, Jeonghwan Kim, Huimin Zhao, Heng Ji. arXiv:2602.20449. https://arxiv.org/abs/2602.20449