蛋白质语言模型太大?用3-bit量化把它缩小7倍
蛋白质语言模型太大?用3-bit量化把它缩小7倍蛋白质语言模型在最近几年变得越来越大。ESM-2有650M参数,如果是更大的版本,参数量可以达到几十亿。这些大模型在蛋白质结构预测、功能注释、药物发现等任务上效果确实好,但有一个实际问题:它们太大了,大到几乎不可能在单个GPU上部署。 更大的模型意味着更大的KV cache——在推理过程中,需要存储attention机制里Key和Value矩阵的缓存。这个缓存的大小和序列长度的平方成正比。处理一个几百个氨基酸的蛋白质序列,KV cache可能就已经是几百MB甚至几个GB。对于想要在笔记本电脑上跑模型的人来说,这显然不现实。 解决这个问题的一个常见方法是量化——把原本用32位浮点数存储的参数压缩到更少的位数。但这个方向有一个难点:3-bit量化(在每个参数上用3个比特表示)一直很难做成功。 这篇论文解决了这个问题。 论文标题是 “TurboESM: Ultra-Efficient 3-Bit KV Cache Quantization for Protein Language Models with Orthogonal Rotation and QJL Correction”,2026年3月27日提交到arXiv,作者是Yue Hu、Junqing Wang、Yingchao Liu。 方法的核心是把Google的一个叫Tur...
蛋白质语言模型真的和语言模型一样吗?
蛋白质语言模型真的和语言模型一样吗?这个问题看起来有点奇怪。蛋白质语言模型(Protein Language Model,PLM)本身就是从自然语言处理里的Transformer架构借过来的——BERT、GPT 这些模型被用来处理氨基酸序列。所以如果有人问”它们有什么不同”,听起来像是在问”一把钥匙和另一把钥匙有什么不同”。 但最近有一篇论文系统地研究了这个问题,发现答案没那么简单。 这篇论文叫 “Protein Language Models Diverge from Natural Language: Comparative Analysis and Improved Inference”,2026年2月23日提交到arXiv,作者是Anna Hart、Chi Han等人,来自伊利诺伊大学厄本那-香槟分校和俄勒冈大学。 研究的核心问题是:把一个为自然语言设计的Transformer架构直接拿来处理蛋白质序列,这个过程中有什么东西悄悄改变了? 先说一个背景。蛋白质由20种氨基酸组成,氨基酸序列本质上也是一个”句子”——每个位置有一个token(氨基酸),整个序列有语法结构(蛋白质的折叠规律)。所以研究者很自然地认为:既然NLP领域已经证明了Transformer在处理序列数据上的强大能力,把它用到蛋白质上应该也很有效。 这确实work了。ESM、ProtBERT、Pro...
神经网络与生命科学的深度融合——从感知机到生成式AI的演进之路
神经网络与生命科学的深度融合——从感知机到生成式AI的演进之路生物学正在变成一门数据科学。 人类基因组有30亿个碱基对,一次单细胞RNA测序可以同时测量上万个基因的表达水平,蛋白质结构数据库里的分子数量已经超过20万个。这些数据量的增长速度远超人类手动分析的能力极限。 处理这些数据的工具,正在从传统的统计模型和物理模拟,转向深度学习。 这不是一个突然的转变。从上世纪80年代的感知机开始,神经网络经过了几十年的演进,发展出了多种不同的架构——CNN、RNN、Transformer、GAN、GNN、SSM……每一种架构在处理特定类型的数据时有各自的优势。 而生物数据恰好是多种类型数据的集合:一维序列、三维结构、基因调控网络、细胞图谱、分子图……没有一种神经网络架构能够包打一切。 这就是本专题的出发点:系统梳理各类神经网络架构在生物信息学中的应用,让研究者能够根据自己面对的数据类型和科学问题,选择合适的计算工具。 生物学为什么需要多种神经网络生物数据有几个基本特性,每一种特性对应着不同的计算需求。 序列性。 DNA、RNA、蛋白质都是一维序列。序列建模需要捕捉长程依赖关系——比如DNA上一个增强子可能跨越几十万个碱基对调控靶基因的表达,蛋白质里相隔数百个氨基酸的残基在折叠后可能紧密相邻。Transformer和RNN擅长处理这类问题。 空间结构。 蛋白质和核酸在三维空间中有确定的...
Transformer架构在生物信息学中的基础应用与前瞻
Transformer架构在生物信息学中的基础应用与前瞻在过去数年中,深度学习技术在计算生物学领域取得了显著进展。其中,2017年提出的Transformer架构凭借其核心的自注意力机制,不仅在自然语言处理(NLP)领域引发了范式转变,更因其对序列数据强大的建模能力,迅速成为生物信息学研究的底层基础设施。生物学本质上是一门研究信息存储、传递与表达的学科。从DNA中四个碱基的线性排列,到RNA的转录加工,再到蛋白质中氨基酸的折叠与组装,生命系统遵循着一套复杂的“编码规则”。这种将离散单元组合成具有高级功能序列的特性,与人类自然语言存在高度的结构相似性。本文旨在从宏观视角剖析Transformer架构契合生物序列建模的底层逻辑,梳理其在当前生物信息学核心场景中的基础应用,并客观探讨该技术面临的瓶颈与未来演进方向。 一、 序列到结构的映射:Transformer的底层逻辑优势在Transformer被广泛应用之前,生物信息学处理一维序列数据(如DNA、蛋白质序列)主要依赖隐马尔可夫模型(HMM)、循环神经网络(RNN)或卷积神经网络(CNN)。然而,生物大分子序列具有两个固有的计算挑战:超长距离的依赖关系与高度的长度可变性。Transformer的架构设计恰好为解决这些问题提供了新的计算路径。 1. 突破长程相互作用的建模限制生物大分子的生物学功能高度依赖于其三维空间结构,而三维...
生信研究里听起来像愚人节玩笑,但其实是真的一些事
生信研究里听起来像愚人节玩笑,但其实是真的一些事每年愚人节都会看到很多假新闻。AI 通过了医学考试、室温超导成功了、某公司宣布实现了核聚变发电——这些一看就知道是开玩笑的。 但生物学这个领域有个特点:有时候真实的研究比玩笑还离谱。读这类论文的时候经常需要确认一下:这是正经发表的吗? 以下八个都是。 一、用语言模型预测蛋白质会怎么进化先从一个听起来最像开玩笑的讲起。 有人训练了一个语言模型——就是那种读海量蛋白质序列、学会预测下一个氨基酸的模型——然后用它来指导抗体的定向进化。 具体做法是:给模型看一个抗体序列,问它”如果这个抗体要提高对目标抗原的亲和力,自然界可能会怎么突变它”。模型不需要知道任何关于抗原的结构信息,也不需要知道什么是”亲和力”。它只知道:在自然界见过的所有蛋白质里,什么样的突变是合理的、可能存在的。 用这个方法,做了七个人源抗体的亲和力成熟。每个抗体只测了不到 20 个突变变体,筛了两轮。四个临床上已经比较成熟的抗体,亲和力提高了最多 7 倍。还有三个还没成熟的抗体,亲和力提高了最多 160 倍。 这个数字听起来不真实。160 倍的提升,通常需要做很多轮耗时的实验室筛选才能达到。 为什么这个思路能 work。语言模型在训练时见过数百万条天然蛋白质序列,它学到的不只是表层的统计规律,而是更深层的进化约束:什么样的突变在自然界里会出现,什么样的突变会让蛋白质失...
STORM:空间转录组数据里的三个老问题,一个框架能不能一起解决
STORM:空间转录组数据里的三个老问题,一个框架能不能一起解决空间转录组技术解决了单细胞测序最大的缺陷:位置信息的丢失。 传统单细胞测序需要把组织打散成单个细胞,细胞在组织里的位置就没了。你知道这个细胞的基因表达谱,但不知道它在肿瘤边缘还是肿瘤中心,不知道它的邻居是什么细胞。空间转录组把基因表达和空间坐标绑在一起,让你可以在组织切片上直接看基因表达的分布。 但空间转录组数据用起来有三个问题,做过这类分析的人都遇到过。 第一个是批次效应。 空间转录组实验通常需要多个切片——同一个样本的不同切面,或者不同样本之间的比较。问题是,不同批次的切片之间存在系统性偏差。同一个细胞类型,在不同批次里测出来的基因表达值可能差很多,原因可能是组织处理方式、芯片批次、测序深度,甚至切片的厚度。 批次效应不处理,不同切片的数据就没法放在一起分析。 传统的批次校正方法(比如 ComBat、Harmony)是在基因层面做的:对每个基因,估计批次效应的大小,然后减掉。这个思路在单细胞数据上还算有效,但在空间转录组数据上有个额外的麻烦:不同切片的空间维度不一样。一张切片可能有 3000 个 spot,另一张可能有 5000 个,而且它们的空间坐标系也不同。你没办法直接把两张切片的数据对齐。 第二个是细胞类型混合。 空间转录组技术的分辨率还没有达到单细胞级别。10x Visium 的每个 spot 直径...
MIOFlow 2.0:从快照数据里推断细胞怎么走过来的
MIOFlow 2.0:从快照数据里推断细胞怎么走过来的单细胞转录组测序有一个根本性的限制:它是破坏性的。 你把细胞裂解,提取 RNA,测序。这个细胞就没了。你没办法追踪同一个细胞在不同时间点的状态变化。你能做的,是在某个时刻把一批细胞全部测完,得到一张”快照”——这批细胞在这个时刻各自长什么样。 这张快照里有很多信息,但缺少一个维度:时间。 细胞轨迹推断(trajectory inference)这个方向就是为了解决这个问题。核心假设是:一批细胞里,不同的细胞处于分化过程的不同阶段。有的刚开始分化,有的已经分化到一半,有的已经到了终态。如果你把这些细胞按照基因表达的相似性排列,就能大致还原出分化的路径。 Monocle 是这个方向最早的工具之一,用的是主成分分析加最小生成树,把细胞排成一条轨迹。后来的 PAGA、Slingshot 等方法在这个基础上做了各种改进,但基本思路类似:在高维基因表达空间里,找一条或几条路径,把细胞串起来。 这类方法有一个共同的问题:它们假设细胞的转变是确定性的。给定一个起始状态,细胞会沿着一条固定的路径走到终态。但真实的生物过程不是这样的。 细胞命运决定本质上是随机的。 同一个干细胞,在完全相同的培养条件下,有的会分化成神经元,有的会分化成胶质细胞。这不是因为实验条件控制不好,而是因为基因表达本身就有随机性——转录因子的结合、RNA 聚合酶的...
DNA 基础模型的嵌入表示会不会泄露原始序列?
DNA 基础模型的嵌入表示会不会泄露原始序列?DNA foundation model 正在变成生信分析的基础设施。从 GenSLM、DNABERT-2 到 Nucleotide Transformer,这些模型可以把任意 DNA 序列编码成固定维度的向量,用于变异检测、调控元件预测、物种分类等下游任务。 很多研究者认为嵌入表示是”安全”的——分享的是向量,不是序列本身。向量只是一组数字,看起来不包含可读的生物学信息。 这篇 2026-03-06 提交的论文 “How Private Are DNA Embeddings?” 挑战了这个假设。 DNA foundation model 的核心能力是把 DNA 序列编码成语义向量。这个过程类似于 NLP 里的 word embedding:把离散的 token 映射到连续向量空间,让语义相似的序列在向量空间里距离更近。 具体流程是先把 DNA 序列切分成 k-mer,用 Transformer 编码器处理,输出每个位置的向量表示或整个序列的聚合向量。这个向量捕获了序列的”语义”——调控模式、编码区域特征、物种特异性等。 嵌入表示即服务(Embeddings-as-a-Service,EaaS)正在变成常见的商业模式:服务提供商部署 DNA foundation model,用户提交序列获得嵌入表示,在本地做下游任务。用户不需要...
周报|GitHub、AI 技术与新模型
周报|GitHub、AI 技术与新模型 本文信息由 AI 爬取+整理,经人工核验后发布。AI 爬取可能会有遗漏,欢迎在评论区补充。如有偏差,也欢迎指正。 本期覆盖时间:2026-03-22 ~ 2026-03-28(含) 这周 GitHub 上的 Agent 框架项目爆发式增长,Trending 榜单有一半是 Agent 工具类。但不能只看热闹——这背后有三条明确的技术分化方向在同时推进:工具层的完善、方法论层的积累、以及记忆层的突破。同时 Agent 安全协议方向出现了值得关注的新进展。 一、GitHub 每周热门内容1. everything-claude-code:Agent Harness 的工程化实践范本GitHub: affaan-m/everything-claude-code本周新增 stars:约 22,000 | 总 stars:约 113,000 | 贡献者:30 人 everything-claude-code 这周 Star 增速极快。它不是某个具体工具,而是一套经过 10 个月真实产品开发打磨出来的 Agent Harness 性能优化系统。它的定位是”让 Claude Code、Cursor、Codex、OpenCode 这些 Harness 从能用变成好用”。 这个项目在解决什么问题 Agent Harness 在实际使用中会遇...
周报|GitHub、AI 技术与新模型
周报|GitHub、AI 技术与新模型 本文信息由 AI 爬取+整理,经人工核验后发布。AI 爬取可能会有遗漏,欢迎在评论区补充。如有偏差,也欢迎指正。 本期覆盖时间:2026-03-22 ~ 2026-03-28(含) 这周 GitHub 上的 Agent 框架项目爆发式增长,Trending 榜单有一半是 Agent 工具类。背后有三条明确的技术分化方向在同时推进:工具层的完善、方法论层的积累、以及记忆层的突破。同时 Agent 安全协议方向出现了值得关注的新进展。 一、GitHub 每周热门内容1. everything-claude-code:Agent Harness 的工程化实践范本GitHub: affaan-m/everything-claude-code本周新增 stars:约 22,000 | 总 stars:约 113,000 | 贡献者:30 人 everything-claude-code 这周 Star 增速极快。它不是某个具体工具,而是一套经过 10 个月真实产品开发打磨出来的 Agent Harness 性能优化系统,目标是让 Claude Code、Cursor、Codex、OpenCode 这些 Harness 从”能用”变成”好用”。 这个项目在解决什么问题 Agent Harness 在实际使用中会遇到一系列具体问题:T...